robots.txt 要不要拦截 GPTBot、ClaudeBot 等 AI 爬虫
核心要点
- 允许检索抓取与允许把内容用于训练,不是同一件事,需看各爬虫条款。
- 后台、install、uploads 必须 Disallow,与是否做 GEO 无关。
- 全站一刀切拒绝 AI 爬虫,会让你更难出现在对话式答案里。
robots.txt 是抓取许可,不是排名开关。GEO 需要模型读到权威页,因此核心栏目一般应允许抓取。
建议默认
- 允许:首页、服务、百科、案例、资讯文章。
- 禁止:
/gel后台、/install.php、上传目录中的脚本路径。 - 媒体与附件按业务决定,但不要把含隐私的 PDF 暴露在可抓取目录。
和 llms.txt 的关系
robots 说「你可以来」;llms.txt 说「请来这些页」。两者一起用,比只堆关键词更接近官方导览。GEO.YUN 站点的 robots.txt 即按此原则生成。
本文问答
只开放 sitemap 不开网页可以吗?
不可以。sitemap 只是清单,模型仍要抓到可阅读的 HTML 正文。