爬虫封禁误判排查
凌晨 2 点,运维老张接到告警:某站点 IP 因异常请求被 WAF 自动封禁。他怀疑是 Googlebot 爬取时触发了规则。用本工具将封禁日志里的 UA 字符串粘贴解析,确认是 Mozilla/5.0 兼容模式下的 Googlebot,而非伪造爬虫。他随即在 WAF 白名单中放行该 IP,避免次日收录中断。
凌晨三点,日志里一行 `Mozilla/5.0 ... (compatible; Googlebot/2.1; ...)` 冒出来——是真蜘蛛还是爬虫伪装的?UA 解析工具直接拆解 User-Agent 字符串,标出搜索引擎爬虫名称与版本号,并高亮可疑字段。解析过程完全在浏览器本地完成,UA 字符串不上传服务器,适合频繁核对日志的 SEO 从业者。
凌晨 2 点,运维老张接到告警:某站点 IP 因异常请求被 WAF 自动封禁。他怀疑是 Googlebot 爬取时触发了规则。用本工具将封禁日志里的 UA 字符串粘贴解析,确认是 Mozilla/5.0 兼容模式下的 Googlebot,而非伪造爬虫。他随即在 WAF 白名单中放行该 IP,避免次日收录中断。
内容运营小陈每天要分析 CDN 日志中哪些请求是真实蜘蛛、哪些是用户访问,以便准确计算带宽成本。她将日志中数千条 UA 批量复制到工具中,一键区分出 Googlebot、Bingbot 和百度蜘蛛。原本需要写正则过滤半小时的工作,现在 3 分钟完成,且能精准排除伪装成蜘蛛的采集器。
独立站长阿杰刚搭建完一个资讯站,在 Search Console 看到爬取请求但不确定是否真是 Googlebot。他复制了服务器访问日志中的 UA 字符串,用本工具解析后看到操作系统、浏览器内核及爬虫标识完全吻合官方特征,确认蜘蛛无误。随后他放心地配置了 robots.txt 的抓取频率。
安全工程师在调试反爬系统时,需要区分正常用户和恶意爬虫。他将被拦截的 UA 样本输入工具,发现某个 UA 虽然包含“Googlebot”字眼,但解析出的内核版本和操作系统与 Google 官方文档不符,判定为伪造 UA。他据此更新了反爬规则,将误杀率从 12% 降至 3%。
电商运营小周发现竞品站收录量突然暴增,怀疑对方使用了特定爬虫批量抓取商品页。他收集了竞品服务器返回的 UA 列表,用工具逐一解析后发现其中含有大量百度蜘蛛的抓取记录,推断竞品可能调整了 sitemap 提交策略。他据此优化了自己的站内链接结构以提升蜘蛛抓取效率。
| 输入 | 输出 | 说明 |
|---|---|---|
| Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) | 搜索引擎爬虫 | Googlebot | 常规:最标准的 Googlebot UA,验证工具能否正确识别 Google 官方爬虫 |
| Mozilla/5.0 (compatible; bingbot/2.0; +http://www.bing.com/bingbot.htm) | 搜索引擎爬虫 | Bingbot | 常规:Bing 官方爬虫,验证工具对必应蜘蛛的识别准确性 |
| Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.6099.109 Mobile Safari/537.36 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) | 搜索引擎爬虫 | Googlebot (Smartphone) | 边界:Googlebot 移动端 UA,带完整 Android/Chrome 前缀,验证工具是否能剥离浏览器信息并正确归类为爬虫 |
| Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html) | 搜索引擎爬虫 | Baiduspider | 常规:百度蜘蛛标准 UA,验证工具对国内搜索引擎爬虫的支持 |
| Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36 | 普通浏览器 | Chrome 120.0.0.0 | 易错:真实用户 Chrome UA,不含任何爬虫标识,验证工具不会误判为搜索引擎 |
| Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) (fake) | 搜索引擎爬虫 | Googlebot | 边界:UA 末尾带 (fake) 伪装,验证工具是否仅按标识符匹配,不因后缀异常而拒绝识别 |
| Mozilla/5.0 (compatible; Yeti/1.1; +http://naver.me/bot.html) | 搜索引擎爬虫 | Yeti (Naver) | 边界:韩国 Naver 搜索引擎爬虫,验证工具对非主流搜索引擎的支持范围 |
| curl/7.68.0 | 命令行工具 | curl | 易错:极简 UA 只有 curl,无浏览器或爬虫标识,验证工具能否正确归类为工具而非搜索引擎 |
1.误把完整请求头当 UA 字符串解析
Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36; Accept: text/html; User-Agent: Googlebot/2.1Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)UA 解析器只处理 User-Agent 头字段的值,不处理整条 HTTP 请求头。混入 Accept 等字段会导致解析器误判为自定义爬虫或直接返回未知。
2.忽略 Googlebot 的版本号后缀
Googlebot/2.1Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)Googlebot 的 UA 字符串必须包含完整前缀 Mozilla/5.0 (compatible; …) 和版本号。仅写 Googlebot/2.1 会被部分解析器视为非标准格式而无法识别。
3.把 Bingbot 的移动端 UA 当成桌面端
Mozilla/5.0 (iPhone; CPU iPhone OS 14_0 like Mac OS X) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/14.0 Mobile/15E148 Safari/604.1 (compatible; bingbot/2.0; +http://www.bing.com/bingbot.htm)Mozilla/5.0 (compatible; bingbot/2.0; +http://www.bing.com/bingbot.htm)Bingbot 在移动端会附加 Mobile/15E148 等字段,但核心识别词仍是 bingbot/2.0。若只匹配桌面端格式,移动端爬虫会被漏判。
4.百度蜘蛛的 UA 里漏了空格
Mozilla/5.0(compatible;Baiduspider/2.0;+http://www.baidu.com/search/spider.htm)Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.htm)百度蜘蛛的 UA 在 Mozilla/5.0 后必须有空格,compatible 后也有空格。漏空格会导致解析器无法匹配到 Baiduspider 关键词,返回未知。
5.把 YandexBot 当成 Googlebot
Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots)Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)YandexBot 和 Googlebot 的 UA 结构相似,但品牌名不同。解析器依赖品牌名(Googlebot / YandexBot)区分,混用会导致搜索引擎归属错误。
6.用 curl 默认 UA 测试爬虫识别
curl/7.68.0Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)curl 默认 UA 不含任何搜索引擎标识,解析器会返回未知或普通浏览器。测试爬虫识别必须使用真实爬虫 UA,否则结果无参考意义。
7.忽略 UA 中的操作系统版本对 SEO 的影响
Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)普通浏览器 UA 被解析器识别为 Chrome/120,而非爬虫。SEO 场景下需确认目标 UA 是否被搜索引擎爬虫使用,而非用户浏览器。
8.把 DuckDuckBot 当成 Bingbot
Mozilla/5.0 (compatible; DuckDuckBot-Http/1.0; +https://duckduckgo.com/duckduckbot.html)Mozilla/5.0 (compatible; bingbot/2.0; +http://www.bing.com/bingbot.htm)DuckDuckBot 和 Bingbot 都是搜索引擎爬虫,但品牌名不同。解析器按品牌名分类,混用会导致搜索引擎归属错误,影响 SEO 分析。
UA 匹配度 = Σ(规则命中权重) / 总规则权重 × 100%
规则命中权重命中特征规则的权重值之和总规则权重该爬虫所有特征规则权重总和UA 为 'Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)',命中规则:'Googlebot' 权重 0.6、'compatible' 权重 0.3、'http' 权重 0.1,总规则权重 1.0,匹配度 = (0.6+0.3+0.1)/1.0 × 100% = 100%,确认为 Googlebot。
最简单的方法是看 User-Agent 字符串里是否包含 'Googlebot' 关键词,但光靠这个不够,因为很多爬虫和模拟器也会伪造。本工具除了匹配关键词,还会校验 UA 的结构特征,比如 Mozilla/5.0 版本号、操作系统标识和 Chrome/Safari 内核版本号的组合是否与 Google 官方公布的爬虫模式一致。输出结果里会分别显示「匹配的爬虫名称」和「可信度」,如果只有关键词匹配但结构异常,会标注「疑似伪造」。
不同解析工具使用的爬虫特征库版本和验证逻辑不同。有的只做简单字符串匹配,有的会校验 UA 的完整结构,还有的会结合 IP 反向解析来确认。本工具采用的是实时更新的爬虫特征库,同时支持手动输入 IP 进行反向验证,结果区会显示「匹配库版本号」和「验证方式」,方便对比其他工具的结果差异。如果发现不一致,建议以 Google 官方发布的爬虫 IP 段和 User-Agent 格式为准。
可以。本工具的特征库覆盖了百度蜘蛛的全系列变体,包括 Baiduspider、Baiduspider-mobile、Baiduspider-image 等。输入 UA 后,结果区除了显示爬虫名称,还会标注具体子类型(如移动端/图片/视频)。注意百度移动端蜘蛛的 UA 里通常带有 'Mobile' 或 'Android' 标识,但部分 PC 端百度蜘蛛也会携带类似字段,本工具会综合 UA 中的操作系统标识和内核版本来区分。
服务器日志里的 UA 字符串有时会包含换行符、多余的空格或特殊转义字符(如 \n、\t)。本工具输入框只接受纯文本格式,粘贴前建议先检查字符串前后是否有不可见字符。如果日志里是 URL 编码格式(如 %20 代替空格),需要先解码。推荐操作:先用文本编辑器(如记事本)粘贴一遍,确认没有多余符号后,再复制到工具输入框。
不会。本工具是纯前端实现,所有解析逻辑都在浏览器本地执行,输入框里的 UA 字符串不会被发送到任何服务器。解析完成后,结果页面也不会记录或存储任何输入数据。关闭页面或刷新后,输入内容自动清空。如果对隐私有更高要求,可以断网测试:将电脑断开网络后,依然可以正常使用本工具的解析功能。
确实容易混淆,因为两者都基于 Chromium 内核。区别主要在两点:1)Bingbot 的 UA 里 'compatible' 字段后面跟的是 'bingbot/2.0' 或 'bingbot/2.1',而 Googlebot 是 'Googlebot/2.1';2)Bingbot 的 'Mozilla/5.0' 版本号通常是 5.0,而 Googlebot 可能是 5.0 或 5.1。本工具会同时比对这两处关键字段,并在结果区用不同颜色高亮显示匹配到的特征点,方便肉眼快速核对。
部分搜索引擎爬虫(如 YandexBot、DuckDuckBot)的 UA 结构比较精简,只包含核心标识和少量兼容性字段,不像 Googlebot 那样携带完整的浏览器版本和操作系统信息。这是正常现象,不代表工具解析有问题。本工具对短 UA 同样支持,结果区会显示「匹配到的爬虫名称」和「未匹配的字段列表」,如果某个字段没有对应信息,会标注为「未知」。
不能直接查。本工具只解析 User-Agent 字符串本身,不涉及 IP 地址查询。UA 里通常不包含 IP 信息,只有少数爬虫会在 UA 末尾附带注释性的 IP(如 Googlebot 的 'Googlebot/2.1 (+http://www.google.com/bot.html)')。如果需要验证爬虫的真实 IP 归属,建议搭配 IP 地理位置查询工具使用,将 UA 解析结果与 IP 反向 DNS 记录(如 googlebot.com 域名)进行交叉比对。
隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。