直接答案
要让 ChatGPT、Perplexity、Kimi、豆包等 AI 产品在回答中引用你的内容,第一步是让它们的爬虫能抓到你——在 robots.txt 里明确放行主流 AI 爬虫,并确保页面是服务端渲染、正文可直读。大量网站出于"防采集"习惯性屏蔽陌生爬虫,结果是在 AI 搜索时代自愿隐身。
主流 AI 爬虫清单
| UA 标识 | 所属 | 用途 | 建议 |
|---|---|---|---|
| GPTBot | OpenAI | 训练与检索数据采集 | 放行 |
| OAI-SearchBot | OpenAI | ChatGPT 实时检索 | 必须放行 |
| PerplexityBot | Perplexity | 实时检索与引用 | 必须放行 |
| ClaudeBot | Anthropic | 训练与检索 | 放行 |
| Bytespider | 字节跳动 | 豆包/头条系 AI | 放行(国内重点) |
| Google-Extended | Gemini 训练 | 放行 |
robots.txt 写法示例
明确放行的写法(推荐):
User-agent: GPTBot
Allow: /
如需保护后台与重复页,用 Disallow 精确排除目录,而不是整站拉黑。注意:UA 大小写敏感、一行一个 User-agent 段,改完用 Search Console 式工具验证生效。
三个比 robots 更致命的卡点
一是纯前端渲染:AI 爬虫多数不执行 JS,SPA 站点抓到的是空壳,必须服务端渲染或预渲染;二是正文污染:导航、广告、推荐位混在正文里,抽取器分不清哪段是内容,语义 HTML(main、article 标签)能显著改善;三是访问频率限制过于激进,把 AI 爬虫当攻击拦截,WAF 误杀后毫无感知。建议每月用爬虫模拟工具自查一次抓取表现。
小结
放行 AI 爬虫是 GEO 的"入场券",零成本、当天可做。先自查 robots.txt 与渲染方式,再谈内容优化——抓不到,一切白搭。
常见问题快答
放行 AI 爬虫会被拿去训练,亏不亏?
短期看是内容被引用获客的机会成本权衡;折中方案:放行检索类爬虫(OAI-SearchBot、PerplexityBot),训练类(GPTBot)自行取舍。
怎么知道 AI 爬虫来没来?
查服务器访问日志里 GPTBot、Bytespider 等 UA 的请求记录,这是最直接的证据。
SPA 站点抓不到怎么办?
上服务端渲染(SSR)或预渲染,至少对核心内容页输出静态 HTML。
最后更新于 2026-08-14。本文持续修订,重大更新会标注日期。
