logo
登录
实操指南

官网 GEO 诊断:FAQ Schema、JSON-LD、robots 自查清单

2026-08-03 12 分钟阅读

为什么先诊断官网

在所有信源里,官网是唯一你能 100% 控制、且权重最高的权威层来源。AI 在核验「你是谁、卖什么、可不可信」时,官网是它的首选事实基线。但现实里,官网往往:内容写给人看不写给机器看、结构化数据缺失、爬虫被无意挡在门外。结果就是这块最该用好的阵地反而拖了后腿。

本文是一套官网 GEO 自查 SOP。注意:涉及结构化数据、robots 等需要写「代码」的地方,本文一律用文字描述字段与规则,你照着在自己的技术实现里落地即可。

一个判断标准:如果把你的官网核心页交给一个只读纯文本的程序,它能不能准确说出你的品牌定位、产品规格和常见问题答案?能,才算机器可读。

第 1 步:爬虫可达性自查

目标:确保 AI 相关爬虫能合法、顺利地抓到你的内容。

动作

  1. 检查站点的爬虫规则文件(即 robots 规则)是否无意中屏蔽了 AI 爬虫。常见的 AI 爬虫用户代理包括 GPTBot、ClaudeBot、PerplexityBot、Google-Extended 等。
  2. 明确你的策略:希望被 AI 引用,就放行这些爬虫;有内容不想被抓,就在规则里对应禁止特定路径或特定用户代理。这是一个业务决策,不是越开放越好。
  3. 确认站点地图(sitemap)存在且最新,并提交到搜索引擎站长平台——注意 ChatGPT 的网页检索依赖必应(Bing)索引,所以提交必应站长平台尤其重要。
  4. 排查渲染问题:核心内容若依赖前端脚本动态渲染,确认爬虫拿到的初始 HTML 里就有实质内容,而不是空壳。

robots 规则要点(用文字描述,不用代码块)

  • 「用户代理」行指定规则适用于哪个爬虫(如 GPTBot)。
  • 「禁止」行后跟一个路径,表示该爬虫不得抓取此路径;留空或不写则默认允许。
  • 想全站放行某爬虫:为它单独写一组规则,禁止项留空。
  • 想全站屏蔽某爬虫:禁止项写一个斜杠(代表根路径)。

检查点

  • ✅ 已明确每个主流 AI 爬虫是放行还是屏蔽,且与业务意图一致
  • ✅ 站点地图存在、最新,并已提交必应等站长平台
  • ❌ 没有「想被引用却把 AI 爬虫全屏蔽了」的自相矛盾

第 2 步:结构化数据(常见问题标记)自查

目标:让官网的问答内容以机器可读的形式被 AI 准确抽取。

常见问题结构化数据(即 FAQPage 类型,通常以 JSON-LD 形式嵌入页面)的字段构成,用文字描述如下:

  • 顶层类型标为「常见问题页」(FAQPage)。
  • 顶层有一个「主实体」数组,每个元素是一个「问题」(Question)。
  • 每个「问题」包含一个「问题文本」字段(name),以及一个「被接受的答案」(acceptedAnswer)。
  • 「被接受的答案」是一个「答案」(Answer)类型,包含「答案正文」字段(text)。

动作

  1. 在常见问题页 / 产品页放置常见问题标记,覆盖用户真实问法。
  2. 每页只用一个常见问题标记块;若有多组问答,全部并入同一个「主实体」数组。
  3. 确保标记里的每个问题与答案,在可见正文里逐字出现——标记与可见内容必须严格一致。
  4. 每页建议放 5 到 8 个问题,问法用自然口语,不同页面间不重复相同问题。
  5. 用结构化数据校验工具(如富媒体结果测试)验证语法无误。

重要现实提醒:自 2026 年起,常见问题标记在搜索结果里已不再展示「富媒体外观」,但它对 AI 引用与事实核验依然有价值——Gemini 等 AI 会用结构化数据核验主张、判断来源可信度。所以做它的目的已从「拿富媒体展示位」转向「帮 AI 准确抽取与采信」。

检查点

  • ✅ 每页仅一个常见问题标记块,问答与可见正文逐字一致
  • ✅ 问题用真实口语问法,5 到 8 个,跨页不重复
  • ❌ 答案里没有促销话术(标记内容要与中立可核验的正文一致)

第 3 步:文章 / 产品结构化数据自查

目标:让 AI 准确识别内容的作者、时间、实体关系,强化 EEAT。

文章类结构化数据(Article 类型)建议包含的字段,用文字描述:

  • 类型标为「文章」(Article)。
  • 「标题」字段(headline)。
  • 「作者」字段(author),指向一个「人」(Person)实体,含作者姓名;有条件时补作者简介 / 职位。
  • 「发布日期」与「修改日期」字段(datePublished / dateModified)。
  • 「出版方」字段(publisher),指向组织实体,含品牌名与标识。

产品类结构化数据(Product 类型)建议包含:产品名、品牌、关键规格、(如适用)评分与价格信息——同样要与可见内容一致。

动作

  1. 给重要内容页加文章结构化数据,作者指向真实「人」实体并给出简介。
  2. 发布日期与修改日期如实标注,内容更新后同步更新修改日期。
  3. 产品页加产品结构化数据,规格与可见内容一致。
  4. 让品牌的组织实体信息(名称、标识、官方账号)在全站一致,便于 AI 建立实体关联。

检查点

  • ✅ 重要内容页有作者、发布 / 修改日期的结构化标注
  • ✅ 组织实体信息全站一致
  • ❌ 没有声明了「修改日期」却内容长期不更新的虚假新鲜度

第 4 步:内容机器可读性自查

目标:纯文本层面,官网内容本身就清晰、可抽取。

  • 核心页开头即用一两句话讲清「品牌是什么、卖什么、适合谁」
  • 常见问题、产品规格用结构化排版(清单 / 表格),而非大段文字
  • 关键事实(成分、参数、资质)以可核验的具体形式呈现
  • 重要内容不藏在图片里(图片中的文字机器读不到,需配文字说明)
  • 标题层级清晰,每个标题本身就是一个可检索的要点或问题

第 5 步:llms.txt 要不要做

目标:理性看待 llms.txt,不神化、也不必排斥。

事实澄清:llms.txt 是一个放在站点根目录的纯文本文件,用 Markdown 格式列出站点最重要的内容,相当于给 AI 的「内容导航地图」。但要清醒认识三点:

  1. 它是社区约定,没有任何标准组织背书,也没有强制力。
  2. 截至 2026 年,主流证据表明它不是 AI 引用 / 排名的加分项,Google 已明确表示不支持。
  3. 它与爬虫规则文件(robots)角色不同:robots 控制「能不能抓」,llms.txt 只是「在能抓的范围里指个路」。

动作

  1. 不要把 llms.txt 当成可见度灵药——它解决不了内容质量与信源覆盖问题。
  2. 若内容体量大、结构复杂,做一份简洁的 llms.txt 作为内容索引,成本低、无害,可做。
  3. 把精力优先放在前四步(爬虫可达 + 结构化数据 + 机器可读内容),这些才是确定有效的杠杆。

检查点

  • ✅ 清楚 llms.txt 的定位(导航而非控制、非排名因子)
  • ❌ 没有寄希望于一个 llms.txt 文件带来引用暴涨

常见坑

  • 想被 AI 引用,却在 robots 里把 AI 爬虫全屏蔽:自相矛盾,先理清策略。
  • 结构化标记与可见内容不一致:被判为不可信,反受其害。
  • 一个页面堆多个常见问题标记块:违反规范,应合并为一个。
  • 核心内容只在图片里:机器读不到,等于没写。
  • 把 llms.txt 当排名开关:浪费期待,本末倒置。
  • 标了修改日期却内容不更新:虚假新鲜度,损害可信。

官网 GEO 自查清单

  • AI 爬虫放行 / 屏蔽策略明确且与业务意图一致
  • 站点地图最新并已提交必应等站长平台
  • 常见问题标记:每页一个、问答与可见正文逐字一致、口语问法
  • 重要页有文章 / 产品结构化数据,作者与日期如实标注
  • 核心内容机器可读,关键事实不藏在图片里
  • 组织实体信息全站一致
  • 理性对待 llms.txt,优先做前四步

声量如何帮你把官网这块用起来

官网诊断本身是技术活,但它的价值要放进整个 GEO 体系里才显现——官网是权威层地基,地基打好了,还要看 AI 是否真的引用了它。声量 Shengliang 在这里补上「看效果」与「连成闭环」的环节:

  • 引用信源分析会告诉你 AI 在回答里实际引用了哪些信源、官网(权威层)是否被引用,让官网优化有据可依、可验证。
  • GEO 可见度监测覆盖六大平台,让你看到官网内容补齐后,提及率 / 首推率 / 声量份额是否随之变化。
  • 内容生产侧(GEO 选题 → GEO 内容 + D.A.R.T 评分)保证官网之外的讨论层、平台层内容同样机器友好,与官网口径一致。

本文教你把官网这块「自己能控的阵地」修到机器友好;声量帮你验证它是否真的被 AI 采信,并与其余信源层连成一致、自动迭代的整体。