抓取与访问
AI 爬虫访问检查
检查 GPTBot、ClaudeBot、PerplexityBot 等的 robots 许可与服务器真实响应。
01
这个工具检查什么?
四道闸决定 AI 能否读到你的站:robots.txt 许可、服务器是否真的放行爬虫 UA(WAF 常在 robots.txt 允许的情况下照样 403 掉 GPTBot)、不执行 JS 还剩多少正文,以及 meta/响应头的阻断指令。
02
结果该怎么看?
探测从我们自己的服务器发出,只能测 UA 层拦截。每次探测都带一个普通浏览器对照组:对照组自己失败时,结论一律显示"无法判定",绝不误报"被封锁"。Google-Extended 和 Applebot-Extended 只是 robots 令牌,标注为不可探测。
03
下一步该做什么?
如果爬虫在服务器层被拦,要去 CDN/WAF 的 bot 设置里放行——robots.txt 在这一层帮不上忙。
参考来源: OpenAI crawler docs · RFC 9309 Robots Exclusion Protocol
InsightWonder
访问规则会在你不知情时改变
robots.txt 的改动和 CDN 的 bot 规则通常没人通知你。InsightWonder 会定期复检,某个爬虫开始被拦时告警。
开始深度分析- 定期复检 + 变化告警
- 跨 5 个 AI 引擎的可见度与引用分析
- 按影响排序的修复建议,并生成内容