这个Claude是什么蜘蛛

Claude 蜘蛛(ClaudeBot)


就是 Anthropic Claude AI 的爬虫机器人,俗称 Claude 蜘蛛,会访问你的网站抓取网页内容,用于 AI 模型训练、网页阅读、AI 搜索。
你看服务器访问日志里出现 ClaudeBotClaude‑User,就是它来了,做帝国 CMS 建站经常会遇到这个 AI 爬虫。

3 种主要 Claude 爬虫(日志 UA)

  1. ClaudeBot【训练爬虫】 自动批量爬网页,抓取内容用来训练 Claude 大模型,会遵守 robots.txt。 UA 示例: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
  2. Claude‑User【用户触发抓取】 有人在 Claude 对话里,让 AI 读取你的某一个网页链接,才会访问,不会全站乱爬。
  3. Claude‑SearchBot【AI 搜索】 Claude 内置搜索功能调用,用来实时检索网页资料。
老版本遗留:Claude‑Webanthropic‑ai,日志偶尔还能见到。

建站影响(帝国 CMS 站点)


✅优点:允许抓取,你的内容有机会被 Claude 引用,带来少量 AI 来源流量。 ⚠️坏处:
  1. 会消耗服务器带宽、CPU;采集站内容容易被 AI 直接拿去训练。
  2. 静态页面、动态页面都会被抓取;不识别 utm 参数,utm 不影响它访问
  3. 没有公开 IP 段,只能靠 UA+robots.txt 控制,不能 IP 拉黑。

robots.txt 配置(直接复制放到网站根目录 robots.txt)

①全部禁止 Claude 全套爬虫(不想 AI 拿你网站内容训练)

txt

 

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-User
Disallow: /

User-agent: Claude-SearchBot
Disallow: /

User-agent: Claude-Web
Disallow: /

User-agent: anthropic-ai
Disallow: /

②折中方案:禁止模型训练,保留用户实时读取


别人发你网站链接给 Claude,AI 还能读;但是不会批量爬全站训练模型:
txt
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-Web
Disallow: /
User-agent: anthropic-ai
Disallow: /

#下面两个放开,允许用户手动调用读取单页
User-agent: Claude-User
Allow: /
User-agent: Claude-SearchBot
Allow: /

帝国 CMS 额外小提示

  1. robots.txt 修改后不会立刻生效,爬虫过段时间才会读取新规则。
  2. 如果你服务器压力大,可以同时屏蔽 GPTBot、PerplexityBot 这一批 AI 爬虫。
  3. robots.txt 只是礼貌协议;极少数恶意改写 UA 的伪装爬虫不受限制。

延伸阅读: