GeneralCrawlBot/0.1
GeneralCrawlBot/0.1 不属于谷歌、OpenAI、字节等大厂官方公开爬虫 UA,是个人 / 小型项目自定义 User‑Agent(通用爬虫)。
- 没有官方官网、没有公开 IP 段,不在主流 AI 爬虫清单(GPTBot、CCBot、Bytespider)内。
- 名字直译:General‑通用,Crawl‑爬取,Bot‑机器人;版本 0.1,一般是个人写的 Python 爬虫框架,开发者在代码里把 UA 写死为
GeneralCrawlBot/0.1。
它是什么流量
- 大概率个人开发的开源 / 自用采集程序:做网页抓取、RAG 本地知识库、测试爬虫,学生、开发者自用,没有商业大公司背书。
- 也可能是匿名采集脚本:随便手写的 UA 标识,UA 可以随便伪造,不能 100% 信这个名字。
- 它不会遵守 robots.txt 协议的概率很高(个人写的爬虫经常不处理该协议)。
robots.txt 屏蔽写法
如果你服务器日志大量出现这个爬虫,消耗带宽,可以直接拦截:
txt
User‑agent: GeneralCrawlBot/0.1
Disallow: /
WAF/Nginx 防火墙匹配字符串
GeneralCrawlBot即可直接拒绝访问。
排查建议
- 看日志里它的来源 IP,查 IP 归属,是家庭宽带、云服务器、代理池。
- 如果请求频率高、疯狂遍历链接,直接 WAF 拉黑 UA + 拉黑 IP 段。
- ⚠️UA 可以伪造;不能仅凭 UA 信任它,即使叫 GeneralCrawlBot,也有可能是别人冒充的。
和知名爬虫区分
表格
| UA | 归属 | 性质 |
|---|---|---|
| GPTBot/1.1 | OpenAI | 官方 AI 训练爬虫,公开 IP 列表 |
| CCBot/2.0 | CommonCrawl | 非盈利公开数据集爬虫 |
| GeneralCrawlBot/0.1 | 个人 / 小项目 | 自定义 UA,无官方背景 |
补充:网上 GitHub 有个叫GeneralCrawl的开源通用爬虫项目,这个 UA 大概率就来源于这一类自制爬虫工程。
