官网 GEO 诊断:FAQ Schema、JSON-LD、robots 自查清单
为什么先诊断官网
在所有信源里,官网是唯一你能 100% 控制、且权重最高的权威层来源。AI 在核验「你是谁、卖什么、可不可信」时,官网是它的首选事实基线。但现实里,官网往往:内容写给人看不写给机器看、结构化数据缺失、爬虫被无意挡在门外。结果就是这块最该用好的阵地反而拖了后腿。
本文是一套官网 GEO 自查 SOP。注意:涉及结构化数据、robots 等需要写「代码」的地方,本文一律用文字描述字段与规则,你照着在自己的技术实现里落地即可。
一个判断标准:如果把你的官网核心页交给一个只读纯文本的程序,它能不能准确说出你的品牌定位、产品规格和常见问题答案?能,才算机器可读。
第 1 步:爬虫可达性自查
目标:确保 AI 相关爬虫能合法、顺利地抓到你的内容。
动作:
- 检查站点的爬虫规则文件(即 robots 规则)是否无意中屏蔽了 AI 爬虫。常见的 AI 爬虫用户代理包括 GPTBot、ClaudeBot、PerplexityBot、Google-Extended 等。
- 明确你的策略:希望被 AI 引用,就放行这些爬虫;有内容不想被抓,就在规则里对应禁止特定路径或特定用户代理。这是一个业务决策,不是越开放越好。
- 确认站点地图(sitemap)存在且最新,并提交到搜索引擎站长平台——注意 ChatGPT 的网页检索依赖必应(Bing)索引,所以提交必应站长平台尤其重要。
- 排查渲染问题:核心内容若依赖前端脚本动态渲染,确认爬虫拿到的初始 HTML 里就有实质内容,而不是空壳。
robots 规则要点(用文字描述,不用代码块):
- 「用户代理」行指定规则适用于哪个爬虫(如 GPTBot)。
- 「禁止」行后跟一个路径,表示该爬虫不得抓取此路径;留空或不写则默认允许。
- 想全站放行某爬虫:为它单独写一组规则,禁止项留空。
- 想全站屏蔽某爬虫:禁止项写一个斜杠(代表根路径)。
检查点:
- ✅ 已明确每个主流 AI 爬虫是放行还是屏蔽,且与业务意图一致
- ✅ 站点地图存在、最新,并已提交必应等站长平台
- ❌ 没有「想被引用却把 AI 爬虫全屏蔽了」的自相矛盾
第 2 步:结构化数据(常见问题标记)自查
目标:让官网的问答内容以机器可读的形式被 AI 准确抽取。
常见问题结构化数据(即 FAQPage 类型,通常以 JSON-LD 形式嵌入页面)的字段构成,用文字描述如下:
- 顶层类型标为「常见问题页」(FAQPage)。
- 顶层有一个「主实体」数组,每个元素是一个「问题」(Question)。
- 每个「问题」包含一个「问题文本」字段(name),以及一个「被接受的答案」(acceptedAnswer)。
- 「被接受的答案」是一个「答案」(Answer)类型,包含「答案正文」字段(text)。
动作:
- 在常见问题页 / 产品页放置常见问题标记,覆盖用户真实问法。
- 每页只用一个常见问题标记块;若有多组问答,全部并入同一个「主实体」数组。
- 确保标记里的每个问题与答案,在可见正文里逐字出现——标记与可见内容必须严格一致。
- 每页建议放 5 到 8 个问题,问法用自然口语,不同页面间不重复相同问题。
- 用结构化数据校验工具(如富媒体结果测试)验证语法无误。
重要现实提醒:自 2026 年起,常见问题标记在搜索结果里已不再展示「富媒体外观」,但它对 AI 引用与事实核验依然有价值——Gemini 等 AI 会用结构化数据核验主张、判断来源可信度。所以做它的目的已从「拿富媒体展示位」转向「帮 AI 准确抽取与采信」。
检查点:
- ✅ 每页仅一个常见问题标记块,问答与可见正文逐字一致
- ✅ 问题用真实口语问法,5 到 8 个,跨页不重复
- ❌ 答案里没有促销话术(标记内容要与中立可核验的正文一致)
第 3 步:文章 / 产品结构化数据自查
目标:让 AI 准确识别内容的作者、时间、实体关系,强化 EEAT。
文章类结构化数据(Article 类型)建议包含的字段,用文字描述:
- 类型标为「文章」(Article)。
- 「标题」字段(headline)。
- 「作者」字段(author),指向一个「人」(Person)实体,含作者姓名;有条件时补作者简介 / 职位。
- 「发布日期」与「修改日期」字段(datePublished / dateModified)。
- 「出版方」字段(publisher),指向组织实体,含品牌名与标识。
产品类结构化数据(Product 类型)建议包含:产品名、品牌、关键规格、(如适用)评分与价格信息——同样要与可见内容一致。
动作:
- 给重要内容页加文章结构化数据,作者指向真实「人」实体并给出简介。
- 发布日期与修改日期如实标注,内容更新后同步更新修改日期。
- 产品页加产品结构化数据,规格与可见内容一致。
- 让品牌的组织实体信息(名称、标识、官方账号)在全站一致,便于 AI 建立实体关联。
检查点:
- ✅ 重要内容页有作者、发布 / 修改日期的结构化标注
- ✅ 组织实体信息全站一致
- ❌ 没有声明了「修改日期」却内容长期不更新的虚假新鲜度
第 4 步:内容机器可读性自查
目标:纯文本层面,官网内容本身就清晰、可抽取。
- 核心页开头即用一两句话讲清「品牌是什么、卖什么、适合谁」
- 常见问题、产品规格用结构化排版(清单 / 表格),而非大段文字
- 关键事实(成分、参数、资质)以可核验的具体形式呈现
- 重要内容不藏在图片里(图片中的文字机器读不到,需配文字说明)
- 标题层级清晰,每个标题本身就是一个可检索的要点或问题
第 5 步:llms.txt 要不要做
目标:理性看待 llms.txt,不神化、也不必排斥。
事实澄清:llms.txt 是一个放在站点根目录的纯文本文件,用 Markdown 格式列出站点最重要的内容,相当于给 AI 的「内容导航地图」。但要清醒认识三点:
- 它是社区约定,没有任何标准组织背书,也没有强制力。
- 截至 2026 年,主流证据表明它不是 AI 引用 / 排名的加分项,Google 已明确表示不支持。
- 它与爬虫规则文件(robots)角色不同:robots 控制「能不能抓」,llms.txt 只是「在能抓的范围里指个路」。
动作:
- 不要把 llms.txt 当成可见度灵药——它解决不了内容质量与信源覆盖问题。
- 若内容体量大、结构复杂,做一份简洁的 llms.txt 作为内容索引,成本低、无害,可做。
- 把精力优先放在前四步(爬虫可达 + 结构化数据 + 机器可读内容),这些才是确定有效的杠杆。
检查点:
- ✅ 清楚 llms.txt 的定位(导航而非控制、非排名因子)
- ❌ 没有寄希望于一个 llms.txt 文件带来引用暴涨
常见坑
- 想被 AI 引用,却在 robots 里把 AI 爬虫全屏蔽:自相矛盾,先理清策略。
- 结构化标记与可见内容不一致:被判为不可信,反受其害。
- 一个页面堆多个常见问题标记块:违反规范,应合并为一个。
- 核心内容只在图片里:机器读不到,等于没写。
- 把 llms.txt 当排名开关:浪费期待,本末倒置。
- 标了修改日期却内容不更新:虚假新鲜度,损害可信。
官网 GEO 自查清单
- AI 爬虫放行 / 屏蔽策略明确且与业务意图一致
- 站点地图最新并已提交必应等站长平台
- 常见问题标记:每页一个、问答与可见正文逐字一致、口语问法
- 重要页有文章 / 产品结构化数据,作者与日期如实标注
- 核心内容机器可读,关键事实不藏在图片里
- 组织实体信息全站一致
- 理性对待 llms.txt,优先做前四步
声量如何帮你把官网这块用起来
官网诊断本身是技术活,但它的价值要放进整个 GEO 体系里才显现——官网是权威层地基,地基打好了,还要看 AI 是否真的引用了它。声量 Shengliang 在这里补上「看效果」与「连成闭环」的环节:
- 引用信源分析会告诉你 AI 在回答里实际引用了哪些信源、官网(权威层)是否被引用,让官网优化有据可依、可验证。
- GEO 可见度监测覆盖六大平台,让你看到官网内容补齐后,提及率 / 首推率 / 声量份额是否随之变化。
- 内容生产侧(GEO 选题 → GEO 内容 + D.A.R.T 评分)保证官网之外的讨论层、平台层内容同样机器友好,与官网口径一致。
本文教你把官网这块「自己能控的阵地」修到机器友好;声量帮你验证它是否真的被 AI 采信,并与其余信源层连成一致、自动迭代的整体。
相关文章
0→1 搭建品牌 GEO 监测体系的 5 步法
从零搭一套能跑起来的品牌 GEO 监测体系:先把品牌实体和竞品定清楚,再建意图词库、选平台、立指标看板,最后固定复测节奏。本文给出每一步的目标、动作、产出与检查点,照着做一周内即可上线第一版看板。
如何为 AI 写内容:结构化、可引用、EEAT 写作清单
为 AI 写作和为人写作不是一回事:LLM 要能从你的内容里「抽出一段话」直接当答案。本文给出一套可执行的写作清单——结论前置、段落可抽取、事实可核验、EEAT 信号到位、信源标注、问答式结构,附逐项检查点与常见反例。
信源矩阵布局指南:权威层 / 讨论层 / 平台层怎么铺
AI 答案里引用谁,取决于你在哪些地方留下了一致、可信的痕迹。本文把信源拆成权威层、讨论层、平台层三层,给出每层的定义、平台清单、内容形态与铺设优先级,并给出一套从 0 起步的铺设节奏与检查清单。
