# 本文件只管本站自己的路径口径。训练类抓取器的黑名单不写在这里:Cloudflare 会 # 往站点 robots.txt 注入一段托管内容统一管那份名单,而新的抓取器层出不穷,托管 # 名单跟得上、手抄一份跟不上。两处各写一份的下场是改了那边忘了这边,爬虫读到 # 自相矛盾的两段。 # # Content signals (see https://contentsignals.org): # search=yes 欢迎建立检索索引与带出处的摘录 # ai-input=yes 欢迎带出处的实时引用(RAG/检索增强,与本站定位一致) # ai-train=no 不许可用于模型训练(版权保留声明) # 带筛选参数的专题页与投稿表单不许抓。页级 noindex 挡的是「收不收进索引」,挡不住 # 「抓不抓」——爬虫得先把页面取回来才读得到那行 meta。图书馆专题的筛选参数两两相乘 # 出的地址没有穷尽,每一个都要跑一遍查询;投稿是张空表单,抓一万次也只有一个样子。 # 无参的专题页照旧放行:那是招牌页,要收录。 User-agent: * Content-Signal: search=yes,ai-input=yes,ai-train=no,use=reference Disallow: /admin/ Disallow: /search/ Disallow: /submit/ Disallow: /topic/library/? Disallow: /topic/archive/? Allow: / # 检索类 AI 抓取器显式放行。它们负责的是 AI 回答里的引用与出处——正是本站要 # 的那份流量,与上面 ai-train=no 并不冲突:不许拿去训练,欢迎带着出处引用。 # 只靠通配符组默认放行不够稳,托管块或日后收紧的 * 组都可能顺手误伤。 # # 六个名字合成一组,不是各写一组。robots.txt 的匹配规则是「爬虫只认最具体的 # 那一组」:自己有组就完全不读 * 组。各写一组只写 Allow: / 的话,等于把 # /admin/ 与 /search/ 对这六家全放开,还让它们读不到 Content-Signal。连写的 # User-agent 行共享同一组(RFC 9309),下面四行对六家同时生效。 User-agent: OAI-SearchBot User-agent: Claude-SearchBot User-agent: PerplexityBot User-agent: ChatGPT-User User-agent: Claude-User User-agent: Perplexity-User Content-Signal: search=yes,ai-input=yes,ai-train=no,use=reference Disallow: /admin/ Disallow: /search/ Disallow: /submit/ Disallow: /topic/library/? Disallow: /topic/archive/? Allow: / Sitemap: https://mulu.1012.wiki/sitemap.xml