蜘蛛 / 爬虫 UA 识别工具
粘贴 User-Agent 字符串,识别它是哪家搜索引擎蜘蛛、AI 爬虫还是采集器/扫描器,并给出官方 rDNS 双向验证方法(防 UA 伪造)。
搜索引擎蜘蛛(10)
| 名称 | UA 关键词 | 说明 |
|---|---|---|
| 百度蜘蛛 Baiduspider | baiduspider |
百度搜索引擎爬虫,中文搜索最大来源。 |
| Google 谷歌蜘蛛 | googlebot |
Google 搜索引擎爬虫。 |
| 必应 Bingbot | bingbot msnbot |
微软 Bing 搜索引擎爬虫。 |
| 搜狗蜘蛛 Sogou | sogou |
搜狗搜索引擎爬虫。 |
| 360 蜘蛛 360Spider | 360spider haosou so.com |
360 搜索(好搜)爬虫。 |
| 神马蜘蛛 Shenma | yisouspider shenmaspider sm.cn |
UC 神马搜索(移动端)爬虫。 |
| 字节跳动蜘蛛 Bytespider | bytespider |
字节跳动(今日头条/抖音搜索)爬虫。 |
| Yandex 俄罗斯 | yandex |
俄罗斯最大搜索引擎爬虫。 |
| DuckDuckGo | duckduckbot |
DuckDuckGo 隐私搜索引擎爬虫。 |
| Apple 苹果 | applebot |
Apple(Siri/Spotlight)爬虫。 |
AI 爬虫(11)
| 名称 | UA 关键词 | 说明 |
|---|---|---|
| OpenAI GPTBot | gptbot |
OpenAI 训练数据爬虫。 |
| OpenAI 检索 | oai-searchbot chatgpt-user |
ChatGPT 实时检索/搜索爬虫。 |
| Anthropic ClaudeBot | claudebot anthropic-ai claude-web |
Anthropic Claude 训练/检索爬虫。 |
| Common Crawl CCBot | ccbot |
公共爬取数据集(常用于 AI 训练)。 |
| Google Extended | google-extended |
Google AI(Gemini)训练用途标识。 |
| Perplexity | perplexitybot |
Perplexity AI 检索爬虫。 |
| Amazon | amazonbot |
Amazon(Alexa/AI)爬虫。 |
| Meta AI | meta-externalagent facebookbot |
Meta(Facebook)AI 爬虫。 |
| Cohere | cohere-ai |
Cohere AI 爬虫。 |
| Diffbot | diffbot |
结构化数据抽取爬虫。 |
| You.com | youbot |
You.com AI 搜索爬虫。 |
采集器 / 扫描器(10)
| 名称 | UA 关键词 | 说明 |
|---|---|---|
| MJ12bot | mj12bot |
Majestic SEO 外链分析爬虫(吃带宽)。 |
| AhrefsBot | ahrefsbot |
Ahrefs SEO 外链分析爬虫。 |
| SemrushBot | semrushbot |
Semrush SEO 分析爬虫。 |
| DotBot | dotbot |
Moz SEO 爬虫。 |
| BLEXBot | blexbot |
webmeup SEO 爬虫。 |
| PetalBot | petalbot |
华为 Petal 搜索爬虫(争议,常被视为激进)。 |
| DataForSeo | dataforseo |
SEO 数据采集。 |
| ZoomInfoBot | zoominfobot |
商业信息采集。 |
| 常见脚本采集器 | python-requests scrapy httpclient go-http-client curl/ wget/ python-urllib httrack nutch okhttp java/ node-fetch axios |
编程库/命令行采集工具(Python/Go/爬虫框架等),非浏览器。 |
| 安全扫描器 | masscan zgrab nmap sqlmap nikto nessus |
端口/漏洞扫描器,恶意探测。 |
说明:搜索引擎蜘蛛应放行并引导抓取(利于收录);AI 爬虫可按需限频;采集器/扫描器建议限流或封禁。真伪须以 rDNS 双向验证为准,勿仅凭 UA(可伪造)。