100 个中文网站 AI 搜索可见性实测:门是开着的,但 AI 读不懂

作者:Citable · 数据报告 · · 样本:100 个首页 + 32 篇文章页

越来越多的人直接问 AI,而不是自己去搜。AI 搜索回答问题时,会抓取网页、挑出能引用的段落,再附上来源链接。你的网站能不能出现在这些来源里?我们用同一套规则,检测了媒体、SaaS、电商品牌、科技公司、政企高校 5 类、共 100 个中文网站。

结论先看
  • 门基本是开着的:能检测的 93 个首页中,95% 的 robots.txt 没有挡住主流 AI 搜索爬虫。
  • 但 AI 读不懂:只有 14% 的首页有结构化数据(JSON-LD),3% 声明了网站背后的组织;文章页同时标注了发布日期和更新日期的只有 8%。
  • 约五分之一的首页,服务器返回的 HTML 里几乎没有文字。多数 AI 爬虫不执行 JavaScript,只能读到这份 HTML。
  • 少数大型内容平台主动关门:有的只放行传统搜索引擎,有的只放行部分 AI 爬虫,新出现的 AI 搜索默认被挡在门外。
95%首页放行 AI 搜索爬虫
14%首页有结构化数据
3%首页声明了组织实体
8%文章页同时标注发布与更新日期

测了哪些网站,怎么测的?

局限:服务器冒充爬虫身份的请求,可能和真实爬虫(会经过 IP 验证)看到的结果不同;首页不能代表全站;DeepSeek、Grok 没有公开爬虫名称,无法判断。这些情况我们都记为「无法确认」,不下结论。

发现一:访问层几乎没问题

首页,n = 93。「AI 搜索爬虫」指 OAI-SearchBot、Claude-SearchBot、PerplexityBot、Googlebot、Bingbot 等 12 个用于搜索和实时抓取的爬虫。

这和不少人的直觉相反:多数中文网站并没有屏蔽 AI 爬虫。真正屏蔽的是少数内容平台,而且大多是有意为之,后面单独介绍。

另有 7 个首页我们无法检测:2 个拒绝了检测请求(HTTP 403),1 个返回 HTTP 412;还有 4 家央国企官网无法和我们的检测服务器(Node.js,OpenSSL 3 默认配置)建立连接:一家服务器使用了 OpenSSL 3 默认禁用的旧式 TLS 重协商(用 macOS 自带的 curl 可以打开),一家的证书和域名不匹配,两家直接断开连接。我们无法确认真实的 AI 爬虫会不会同样连不上,但这类问题值得运维团队自查。

发现二:约五分之一的首页,AI 爬虫几乎看不到文字

93 个首页中,有 20 个在不执行 JavaScript 时,服务器返回的 HTML 里几乎没有正文(少于 50 个词),这类页面的内容通常要等浏览器运行脚本后才出现。Vercel 统计过主流 AI 爬虫的抓取行为,多数爬虫不执行 JavaScript。这类首页在 AI 眼里基本是空白的。

其中还有一个少见的情况:一家大型集团官网的 HTML,<head> 里内联了约 7 MB 的脚本和数据,<body> 从第 7 MB 才开始。按 Google 官方文档,Google 搜索的 Googlebot 只读取 HTML 的前 2 MB,也就是说它读不到这个首页的正文;其他 AI 爬虫的上限没有公开。

首页正文少不一定是问题,比如工具类产品的首页本来就字少。更值得关注的是文章页和产品页,下面单独统计。

发现三:AI 读不懂「你是谁」

首页,n = 93,按通过率从高到低排列。

AI 在回答里提到一个品牌,前提是它能把网页和这个品牌对上号。Organization 结构化数据就是告诉机器「这个网站属于谁、官方名称是什么、Logo 在哪、还有哪些官方账号」。93 个首页里只有 3 个这样做了。

证据强度:Google 和 Bing 官方说明会用结构化数据理解实体;但 Ahrefs 的对照研究没有发现结构化数据能直接提升 AI 引用次数。它的作用是让 AI 准确认出你,而不是保证 AI 一定引用你。

发现四:文章页的问题集中在「日期」和「结构」

文章页,n = 31;不同检查的适用页面数不同(例如只有被识别为文章的页面才检查作者和日期),括号里的分母见鼠标悬停提示和文末数据。

日期:24 篇被识别为文章的页面里,7 篇没有任何机器可读的日期,15 篇只有发布日期。遇到时效性问题时,AI 会优先引用能判断「是不是最新」的来源(Ahrefs 的统计显示,AI 助手引用的内容明显比传统搜索结果更新)。

结构:AI 检索会把文章切成段落再挑选。30 篇里只有 3 篇有两个以上清晰的 H2 小节且层级正确;用问题做小节标题的只有 1 篇,而用户问 AI 时,用的几乎都是完整的问句。

发现五:大型内容平台的两种「关门」方式

1. 白名单式:只放行传统搜索引擎

知乎的 robots.txt 只给 Googlebot、Bingbot 和百度系爬虫开了门(另给搜狗和 Google-Extended 开放了个别路径),最后一行 User-agent: * 加 Disallow: / 挡住了其他所有爬虫,包括 ChatGPT、Claude、Perplexity、Kimi 的搜索爬虫。百度首页也是类似的白名单写法。这是平台自己的策略选择,结果是这些 AI 搜索无法直接抓取它们的页面,只能间接使用。

2. 选择性放行

快手的 robots.txt 明确放行了 GPTBot、OAI-SearchBot、PerplexityBot 和 deepseekbot,但没有列出 Claude-SearchBot、Kimi 等爬虫,所以这些爬虫会落到 User-agent: * 的全站禁止里。如果你也用白名单写法,每出现一个新的 AI 搜索,都要记得补上。

如果你也用白名单写法,还要注意 robots.txt 的分组规则:按照标准(RFC 9309),连续的多行 User-agent 属于同一组,下面的规则对它们同时生效。想给不同爬虫不同的规则,组与组之间要用规则行隔开。

哪类网站做得最好?

类别可检测首页平均分
SaaS 软件2086.7
电商与消费品牌2083.5
科技公司与大模型厂商1983.3
媒体资讯1982.6
政府、高校与央国企1577.9

分数是 34 条规则按证据强度加权的结果,访问层权重最高。各类首页大多没有挡住爬虫,所以平均分差距不大;差别主要在结构化和可发现两个维度。政企类有 5 个首页无法检测,没有计入。

网站该怎么改?按投入从小到大排

  1. 检查 robots.txt 的分组。每一组规则前空一行;想区分搜索和训练,就分别写:放行 OAI-SearchBot、Claude-SearchBot、PerplexityBot 等搜索爬虫,单独屏蔽 GPTBot、ClaudeBot、Google-Extended 等训练爬虫。屏蔽训练爬虫不会影响 AI 搜索引用。
  2. 给首页加上组织信息:
    <script type="application/ld+json">
    {
      "@context": "https://schema.org",
      "@type": "Organization",
      "name": "你的品牌全称",
      "url": "https://www.example.com/",
      "logo": "https://www.example.com/logo.png",
      "sameAs": ["https://weibo.com/xxx", "https://www.linkedin.com/company/xxx"]
    }
    </script>
  3. 文章页同时标注发布和更新日期,用 Article 结构化数据里的 datePublished 和 dateModified,页面上也写出来。
  4. 补齐 canonical、sitemap 和 Open Graph。几乎都是模板级改动,改一次全站生效。
  5. 正文用 H2 分小节,部分小节用问句做标题,首段先给结论。这是写作习惯的改变,对新文章立刻有效。
  6. 正文靠 JavaScript 渲染的页面,改成服务端渲染或静态生成。投入最大,但对 AI 爬虫的影响也最直接。
想知道自己的网站怎么样?

Citable 是一个免费的浏览器插件:打开任意网页点一下,就能看到 14 个国内外 AI 平台(其中 12 个可以判断,另外 2 个没有公开爬虫)能不能引用这个页面、为什么,以及可以直接复制的修复代码。检测在你的浏览器本地完成,网页内容不会上传到我们的服务器。

国内网络通常可以直接打开 Edge 加载项商店。

参考资料

数据与更正