100 个中文网站 AI 搜索可见性实测:门是开着的,但 AI 读不懂
越来越多的人直接问 AI,而不是自己去搜。AI 搜索回答问题时,会抓取网页、挑出能引用的段落,再附上来源链接。你的网站能不能出现在这些来源里?我们用同一套规则,检测了媒体、SaaS、电商品牌、科技公司、政企高校 5 类、共 100 个中文网站。
- 门基本是开着的:能检测的 93 个首页中,95% 的 robots.txt 没有挡住主流 AI 搜索爬虫。
- 但 AI 读不懂:只有 14% 的首页有结构化数据(JSON-LD),3% 声明了网站背后的组织;文章页同时标注了发布日期和更新日期的只有 8%。
- 约五分之一的首页,服务器返回的 HTML 里几乎没有文字。多数 AI 爬虫不执行 JavaScript,只能读到这份 HTML。
- 少数大型内容平台主动关门:有的只放行传统搜索引擎,有的只放行部分 AI 爬虫,新出现的 AI 搜索默认被挡在门外。
测了哪些网站,怎么测的?
- 样本:5 类网站各 20 个首页(媒体资讯、SaaS 软件、电商与消费品牌、科技公司与大模型厂商、政府与高校与央国企),另从这些首页中自动挑出 32 篇文章或详情页。
- 时间:2026 年 10 月 7 日,单次检测。
- 引擎版本:使用 2026-10-07 的检测引擎(与插件 1.0.2 相同)。检测过程中修正了引擎的若干问题(见文末更正);1.0.1 版插件对少数页面的结论可能不同。
- 方法:使用 Citable 检测引擎的服务端模式:读取 robots.txt 并按 RFC 9309 判断每个 AI 爬虫能否访问;分别以普通浏览器和 5 个 AI 爬虫的身份请求页面;在不执行 JavaScript 的情况下解析 HTML,共 34 条规则。
- 口径:比例的分母是「这条检查适用的页面数」。7 个首页拒绝了检测请求或无法建立连接,不计入统计,单独说明。
局限:服务器冒充爬虫身份的请求,可能和真实爬虫(会经过 IP 验证)看到的结果不同;首页不能代表全站;DeepSeek、Grok 没有公开爬虫名称,无法判断。这些情况我们都记为「无法确认」,不下结论。
发现一:访问层几乎没问题
首页,n = 93。「AI 搜索爬虫」指 OAI-SearchBot、Claude-SearchBot、PerplexityBot、Googlebot、Bingbot 等 12 个用于搜索和实时抓取的爬虫。
这和不少人的直觉相反:多数中文网站并没有屏蔽 AI 爬虫。真正屏蔽的是少数内容平台,而且大多是有意为之,后面单独介绍。
另有 7 个首页我们无法检测:2 个拒绝了检测请求(HTTP 403),1 个返回 HTTP 412;还有 4 家央国企官网无法和我们的检测服务器(Node.js,OpenSSL 3 默认配置)建立连接:一家服务器使用了 OpenSSL 3 默认禁用的旧式 TLS 重协商(用 macOS 自带的 curl 可以打开),一家的证书和域名不匹配,两家直接断开连接。我们无法确认真实的 AI 爬虫会不会同样连不上,但这类问题值得运维团队自查。
发现二:约五分之一的首页,AI 爬虫几乎看不到文字
93 个首页中,有 20 个在不执行 JavaScript 时,服务器返回的 HTML 里几乎没有正文(少于 50 个词),这类页面的内容通常要等浏览器运行脚本后才出现。Vercel 统计过主流 AI 爬虫的抓取行为,多数爬虫不执行 JavaScript。这类首页在 AI 眼里基本是空白的。
其中还有一个少见的情况:一家大型集团官网的 HTML,<head> 里内联了约 7 MB 的脚本和数据,<body> 从第 7 MB 才开始。按 Google 官方文档,Google 搜索的 Googlebot 只读取 HTML 的前 2 MB,也就是说它读不到这个首页的正文;其他 AI 爬虫的上限没有公开。
首页正文少不一定是问题,比如工具类产品的首页本来就字少。更值得关注的是文章页和产品页,下面单独统计。
发现三:AI 读不懂「你是谁」
首页,n = 93,按通过率从高到低排列。
AI 在回答里提到一个品牌,前提是它能把网页和这个品牌对上号。Organization 结构化数据就是告诉机器「这个网站属于谁、官方名称是什么、Logo 在哪、还有哪些官方账号」。93 个首页里只有 3 个这样做了。
证据强度:Google 和 Bing 官方说明会用结构化数据理解实体;但 Ahrefs 的对照研究没有发现结构化数据能直接提升 AI 引用次数。它的作用是让 AI 准确认出你,而不是保证 AI 一定引用你。
发现四:文章页的问题集中在「日期」和「结构」
文章页,n = 31;不同检查的适用页面数不同(例如只有被识别为文章的页面才检查作者和日期),括号里的分母见鼠标悬停提示和文末数据。
日期:24 篇被识别为文章的页面里,7 篇没有任何机器可读的日期,15 篇只有发布日期。遇到时效性问题时,AI 会优先引用能判断「是不是最新」的来源(Ahrefs 的统计显示,AI 助手引用的内容明显比传统搜索结果更新)。
结构:AI 检索会把文章切成段落再挑选。30 篇里只有 3 篇有两个以上清晰的 H2 小节且层级正确;用问题做小节标题的只有 1 篇,而用户问 AI 时,用的几乎都是完整的问句。
发现五:大型内容平台的两种「关门」方式
1. 白名单式:只放行传统搜索引擎
知乎的 robots.txt 只给 Googlebot、Bingbot 和百度系爬虫开了门(另给搜狗和 Google-Extended 开放了个别路径),最后一行 User-agent: * 加 Disallow: / 挡住了其他所有爬虫,包括 ChatGPT、Claude、Perplexity、Kimi 的搜索爬虫。百度首页也是类似的白名单写法。这是平台自己的策略选择,结果是这些 AI 搜索无法直接抓取它们的页面,只能间接使用。
2. 选择性放行
快手的 robots.txt 明确放行了 GPTBot、OAI-SearchBot、PerplexityBot 和 deepseekbot,但没有列出 Claude-SearchBot、Kimi 等爬虫,所以这些爬虫会落到 User-agent: * 的全站禁止里。如果你也用白名单写法,每出现一个新的 AI 搜索,都要记得补上。
如果你也用白名单写法,还要注意 robots.txt 的分组规则:按照标准(RFC 9309),连续的多行 User-agent 属于同一组,下面的规则对它们同时生效。想给不同爬虫不同的规则,组与组之间要用规则行隔开。
哪类网站做得最好?
| 类别 | 可检测首页 | 平均分 |
|---|---|---|
| SaaS 软件 | 20 | 86.7 |
| 电商与消费品牌 | 20 | 83.5 |
| 科技公司与大模型厂商 | 19 | 83.3 |
| 媒体资讯 | 19 | 82.6 |
| 政府、高校与央国企 | 15 | 77.9 |
分数是 34 条规则按证据强度加权的结果,访问层权重最高。各类首页大多没有挡住爬虫,所以平均分差距不大;差别主要在结构化和可发现两个维度。政企类有 5 个首页无法检测,没有计入。
网站该怎么改?按投入从小到大排
- 检查 robots.txt 的分组。每一组规则前空一行;想区分搜索和训练,就分别写:放行
OAI-SearchBot、Claude-SearchBot、PerplexityBot等搜索爬虫,单独屏蔽GPTBot、ClaudeBot、Google-Extended等训练爬虫。屏蔽训练爬虫不会影响 AI 搜索引用。 - 给首页加上组织信息:
<script type="application/ld+json"> { "@context": "https://schema.org", "@type": "Organization", "name": "你的品牌全称", "url": "https://www.example.com/", "logo": "https://www.example.com/logo.png", "sameAs": ["https://weibo.com/xxx", "https://www.linkedin.com/company/xxx"] } </script> - 文章页同时标注发布和更新日期,用
Article结构化数据里的datePublished和dateModified,页面上也写出来。 - 补齐 canonical、sitemap 和 Open Graph。几乎都是模板级改动,改一次全站生效。
- 正文用 H2 分小节,部分小节用问句做标题,首段先给结论。这是写作习惯的改变,对新文章立刻有效。
- 正文靠 JavaScript 渲染的页面,改成服务端渲染或静态生成。投入最大,但对 AI 爬虫的影响也最直接。
Citable 是一个免费的浏览器插件:打开任意网页点一下,就能看到 14 个国内外 AI 平台(其中 12 个可以判断,另外 2 个没有公开爬虫)能不能引用这个页面、为什么,以及可以直接复制的修复代码。检测在你的浏览器本地完成,网页内容不会上传到我们的服务器。
想在上线当天收到通知?写一封主题为「上线提醒」的邮件给我们(wuyuwentian@gmail.com,在微信里打开可以复制地址),上线后回复你一次,不做其他用途。
国内网络通常可以直接打开 Edge 加载项商店。
参考资料
- RFC 9309:Robots Exclusion Protocol
- OpenAI:爬虫说明(OAI-SearchBot、GPTBot、ChatGPT-User)
- Google 搜索中心:AI 功能与你的网站
- Vercel:The rise of the AI crawler
- Ahrefs:结构化数据与 AI 引用
数据与更正
- 更正(2026-10-07):初版把一家科技媒体「短链接路径被 robots.txt 禁止」误读为「所有文章页被禁止」。这些短链接会跳转到另一条允许抓取的文章路径,文章本身不受影响。我们已删除这条结论,修正了检测工具(改为按跳转后的最终地址判断),并用修正后的工具重跑了全部样本,本页数字均已更新。
- 修订(2026-10-07):按独立复核意见,把「Googlebot 只处理前 15 MB」更正为官方文档的 2 MB;改进文章页识别后再次重跑全部样本(被识别为文章的页面从 17 篇增加到 24 篇,作者、日期两项比例随之变化)。
- 逐站结果(含每项检查的状态):report-2026-10.csv
- 认为某条结论不准确?请通过反馈页告诉我们,核实后会在这里更正并注明。
- 我们计划每月复测一次同一批网站,观察变化。