随着ChatGPT和Google的AI Overviews日益成为信息收集的入口,指代“为被AI引用而进行的优化”的说法——AIO(AI Optimization)、AEO(Answer Engine Optimization)、GEO(Generative Engine Optimization)等——越来越常见。需要说明的是,AIO这一缩写有时也被用来指代Google搜索的AI功能“AI Overviews”,术语尚未统一。不过,流通的信息大多是第三方SEO服务商的推测与经验,而提供AI服务的企业自身官方究竟怎么说,意外地缺乏系统整理。本文仅以OpenAI(ChatGPT)、Anthropic(Claude)、Google(AI Overviews、AI模式、Gemini)三家自行公开的文档与帮助中心为依据,梳理作为“要被AI引用需要做什么”而被官方写明的内容(引文均于2026年7月12日在原文页面确认)。

先说结论 — 官方写明的是“允许爬虫”与“传统SEO”

将三家的官方文档相互对照,可整理成下表。

提供企业关于引用/展示的官方文档官方写明的要点
OpenAI(ChatGPT)爬虫文档+帮助中心文章2篇允许OAI-SearchBot爬取。排名由多个因素决定,没有保证名列前茅的方法
Anthropic(Claude)仅爬虫文档1篇明确写明屏蔽Claude-SearchBotClaude-User可能降低可见性。未能找到为被引用而优化的指南
Google(AI Overviews、AI模式)专用文档+官方优化指南(2026年7月更新)没有额外要求。“面向生成式AI搜索的优化仍属于SEO”。llms.txt等特殊文件会被忽略

归根结底,官方写明的“需要做的事”可归纳为以下三点。

  1. 不妨碍必要的搜索/抓取访问。 这是三家明确共通的最低条件。对训练/模型使用的控制,与搜索用途分属不同的令牌(GPTBotClaudeBotGoogle-Extended)。
  2. 在Google搜索中,传统SEO与有独特性的内容依然是基础。 可爬取、已收录这类技术基础是三家共通的,但具体到推荐有独特视角或亲身经历的内容的,主要是Google。
  3. 不存在保证被引用或名列前茅的特殊手法。 OpenAI明言“没有保证名列前茅的方法”,Google则明确写明会“忽略”llms.txt等“面向AI的特殊文件”。

以下依次查看各家的文档。

OpenAI(ChatGPT)— 允许OAI-SearchBot是首要条件,不保证名列前茅

爬虫共有4种,可在robots.txt中独立控制

OpenAI在爬虫官方文档“Overview of OpenAI Crawlers“中,公开了4种用途各异的机器人。

机器人官方文档中所述用途
OAI-SearchBot为在ChatGPT搜索功能中展示网站而进行的爬取
GPTBot爬取可能用于训练生成式AI基础模型的内容
ChatGPT-User响应用户操作的页面访问(并非自动爬取)
OAI-AdsBot对作为ChatGPT广告提交的页面进行审核

重要的是,各项设置彼此独立。

Each setting is independent of the others – for example, a webmaster can allow OAI-SearchBot in order to appear in search results while disallowing GPTBot to indicate that crawled content should not be used for training OpenAI’s generative AI foundation models.

(各项设置彼此独立。例如,站长可以允许OAI-SearchBot以便在搜索结果中出现,同时拒绝GPTBot,以此表明所爬取的内容不应被用于训练OpenAI的生成式AI基础模型。)

用robots.txt写出来如下所示。

# 拒绝训练、允许在ChatGPT搜索中展示的示例
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

据同一文档,robots.txt的更改要反映到搜索侧系统约需24小时。此外,对OAI-SearchBot选择退出(opt-out)时的行为也有写明。

Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers, though can still appear as navigational links.

(对OAI-SearchBot选择退出的网站将不再显示在ChatGPT的搜索回答中,但仍可能作为导航链接出现。)

另外,ChatGPT-User是响应用户提问、当场去查看页面的访问,文档说明“由于以用户为起点,robots.txt规则可能不适用”“不用于判定是否有资格纳入搜索”。若想控制纳入搜索,官方指引是使用OAI-SearchBot

对“怎样才能出现在搜索结果中”的官方回答

帮助中心的“Publishers and Developers - FAQ“中,就有”如何让我的网站出现在ChatGPT的搜索结果中?“这一设问。回答的开头如下。

Any public website can appear in ChatGPT search. To help ensure your content can be discovered, surfaced, and clearly cited and linked, follow these guidelines: For your site content to be included in summaries and snippets in ChatGPT, make sure you aren’t blocking OAI-SearchBot.

(任何公开的网站都可能出现在ChatGPT搜索中。为确保您的内容能够被发现、被呈现,并被清晰地引用和链接,请遵循以下准则:要让您站点的内容纳入ChatGPT的摘要与片段,请确保没有屏蔽OAI-SearchBot。)

帮助中心的“ChatGPT Search“一文更进一步,明言”没有保证“。

Ranking in ChatGPT Search is based on a number of factors designed to help users find reliable, relevant information. There is no way to guarantee top placement. However, to be included it is important to allow OAI-Searchbot to crawl your site, and ensure your site host and/or content delivery network allows traffic from our published IP addresses.

(ChatGPT搜索的排名基于多个因素,旨在帮助用户找到可靠、相关的信息。没有任何方法能保证名列前茅。不过,要被纳入,重要的是允许OAI-SearchBot爬取您的网站,并确保您的托管和/或CDN允许来自我方公开IP地址的访问。)

除“允许爬虫”外,还把“托管或CDN没有拦截来自OpenAI公开IP地址(在openai.com/searchbot.json公开)的访问”列为条件,这一点容易被忽视。视WAF或反机器人的设置而定,有可能无意间屏蔽了AI爬虫。

除此之外,从这两篇文章还可读出以下三点官方信息。

  • 即便用robots.txt拒绝,链接也可能出现。 若通过对其他页面的爬取或经由第三方搜索服务商获得URL,可能只显示链接和页面标题;若连这也想避免,官方指引是使用noindex元标签(并附注:为了让该元标签被读取,该页面需允许爬取)。
  • 流入可用utm_source=chatgpt.com来计量。 文档明确写明来自ChatGPT的引荐链接会自动附加该UTM参数。
  • ChatGPT搜索也与外部搜索服务商联动。 文档说明搜索时“可能与其他搜索服务商合作”,并列举Microsoft(Bing)与Shopify作为引荐来源。这表明ChatGPT的搜索不仅依赖自有爬虫,也依赖既有的搜索基础设施,即在传统搜索引擎中的收录情况会间接相关。

Anthropic(Claude)— 公开的仅有爬虫控制文档

3种机器人,以及屏蔽时的影响

Anthropic面向站点运营者公开的文档,是帮助中心的“Does Anthropic crawl data from the web, and how can site owners block the crawler?“。这里也定义了3种角色各异的机器人。

机器人官方文档中所述用途屏蔽时(官方记载)
ClaudeBot收集可能有助于模型训练的网页内容此后的内容将被排除在训练数据集之外
Claude-User响应用户提问对网站的访问用户主导的网络搜索中的可见性可能下降
Claude-SearchBot为提高搜索结果的相关性与准确性而进行的爬取搜索结果中的可见性与准确性可能下降

与“要被引用需要做什么”相关的是后两个。屏蔽时的影响有明确写明。

Disabling Claude-User on your site prevents our system from retrieving your content in response to a user query, which may reduce your site’s visibility for user-directed web search.

(在您的站点上停用Claude-User,会使我方系统无法在响应用户查询时抓取您的内容,从而可能降低您站点在用户主导的网络搜索中的可见性。)

Disabling Claude-SearchBot on your site prevents our system from indexing your content for search optimization, which may reduce your site’s visibility and accuracy in user search results.

(在您的站点上停用Claude-SearchBot,会使我方系统无法为搜索优化而对您的内容建立索引,从而可能降低您站点在用户搜索结果中的可见性与准确性。)

Anthropic官方给出的,仅到“允许这些机器人是搜索/抓取中可见性的前提”为止。同一文档还记载:这些机器人尊重robots.txt的标准指令与Crawl-delay扩展,不尝试绕过CAPTCHA等,并公开其爬取来源的IP地址列表。

找不到“为被引用而优化的指南”

在所确认的范围内,Anthropic面向站点运营者公开的文档仅此一篇爬虫控制文档,未能找到讲解“怎么写才更容易被引用”的官方指南(截至2026年7月12日)。网络上能找到许多标榜“为被Claude引用而优化”的文章,但都出自第三方,并非Anthropic官方的推荐,这一点需要注意。

Google(AI Overviews、AI模式)— “面向生成式AI搜索的优化,依然是SEO”

官方见解: 额外要求“没有”

Google在三家中文档最为充实。首先,Google Search Central的“AI features and your website(AI功能与您的网站)“在开头便给出结论。

The best practices for SEO remain relevant for AI features in Google Search (such as AI Overviews and AI Mode). There are no additional requirements to appear in AI Overviews or AI Mode, nor other special optimizations necessary.

(SEO的最佳实践对Google搜索的AI功能(如AI Overviews与AI模式)依然有效。要出现在AI Overviews或AI模式中,没有额外要求,也不需要其他特殊的优化。)

技术要求也与传统搜索相同。

To be eligible to be shown as a supporting link in AI Overviews or AI Mode, a page must be indexed and eligible to be shown in Google Search with a snippet, fulfilling the Search technical requirements. There are no additional technical requirements.

(要有资格作为佐证链接出现在AI Overviews或AI模式中,页面必须已被收录、有资格带片段出现在Google搜索中,并满足搜索的技术要求。没有额外的技术要求。)

想限制展示的手段也与以往相同:nosnippetdata-nosnippetmax-snippetnoindex对AI功能同样有效。

2026年7月更新的官方优化指南 — 对AEO/GEO的直接回答

此外,Google还公开了专用指南“Optimizing your website for generative AI features on Google Search(为Google搜索的生成式AI功能优化您的网站)“(英文版最后更新为2026年7月10日)。这份文档珍贵之处在于,它包含了提供企业自身对AEO、GEO这些术语的直接回答。

From Google Search’s perspective, optimizing for generative AI search is optimizing for the search experience, and thus still SEO.

(从Google搜索的角度看,为生成式AI搜索进行的优化就是为搜索体验进行的优化,因此依然是SEO。)

该指南先说明了AI功能从搜索索引中抓取页面、用以佐证回答的机制(检索增强生成=RAG,也称grounding/接地),以及从一个提问同时跑多个相关搜索的“查询扇出(query fan-out)”,然后列举了推荐事项。要点如下。

  • 创作有独特视角的“非大宗商品化(non-commodity)“内容。 与其重炒人人都能写的泛泛之论,不如基于亲身经历或专业知识的独特内容,据称对在生成式AI搜索中的存在感最为有效。
  • 保持技术上的清晰。 可收录、可爬取,遵循JavaScript SEO的最佳实践,改善页面体验——传统的技术性SEO直接构成基础。
  • 不要为设想的每一种提问变体量产页面。 以操纵排名或生成式AI回答为主要目的的大量生成,被明确写明违反垃圾内容政策(大规模内容滥用)。

另一方面,这份指南的特色在于设有列举“无需做的事”的章节。关于llms.txt文件,写明如下。

You don’t need to create new machine readable files, AI text files, markup, or Markdown to appear in Google Search (including its generative AI capabilities), as Google Search itself doesn’t use them.

(为了出现在Google搜索(包括其生成式AI功能)中,您无需创建新的机器可读文件、AI文本文件、标记或Markdown,因为Google搜索本身并不使用它们。)

在同一章节中,为让AI理解而把内容切碎(分块/chunking)、改写为面向AI的文体、在网络上刻意收集不自然的“提及”、以及对结构化数据的过度投入,也都被列为“不必要”。第三方AIO/GEO措施中常见的项目,就这样被提供企业一方点名否定。

关于计量,此前一直指引称经由AI功能的展示与点击会计入Search Console的搜索效果报告,而这份优化指南则指引使用专用的“生成式AI效果报告(Generative AI performance report)”。同时还有记述称,除搜索的技术要求外,“站点需要在Search Console中被纳入(已启用)搜索的生成式AI功能”。需要说明的是,在确认时点,这些记述仅见于英文版,日文版页面尚未反映计量的章节。

Google-Extended — Gemini的训练/接地是另一个令牌

Google同样有把训练/模型使用与搜索区分开的机制,但与OpenAI、Anthropic不同,它并非独立的爬虫。据爬虫一览的官方文档,Google-Extended没有专属的User-Agent(爬取本身由既有的Google爬虫完成),它是一个用于robots.txt的产品令牌,控制所抓取的内容是否可用于训练Gemini模型,以及在Gemini应用、Vertex AI中进行接地(grounding,即把搜索索引的内容提供给模型)。并且明确写明如下。

Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.

(Google-Extended既不影响站点在Google搜索中的收录,也不被用作Google搜索的排名信号。)

也就是说,搜索的AI功能(AI Overviews、AI模式)始终归Googlebot与搜索索引管辖,屏蔽Google-Extended并不影响在搜索中的展示——这就是其间的划分。

三家共通的格局

训练/模型使用与搜索/抓取的控制被分开

将三家的文档并列,便能看到相同的结构。

类别OpenAIAnthropicGoogle
训练/模型使用的控制(明确写明即便屏蔽也不影响在搜索中的展示)GPTBotClaudeBotGoogle-Extended
搜索/抓取用(屏蔽会降低被纳入/抓取的可能性)OAI-SearchBotClaude-SearchBotGooglebot
以用户操作为起点的访问ChatGPT-UserClaude-User—(无对应的公开区分)

Google-Extended并非独立的爬虫,而是用于robots.txt的产品令牌,它所控制的是Gemini应用、Vertex AI中的训练与接地。Google搜索(含AI Overviews)归Googlebot管辖。

因此,在OpenAI与Anthropic,可以设置成拒绝训练用机器人、同时允许搜索/用户抓取用机器人——即“不想被用于训练,但想被AI的回答引用”。在Google,即便拒绝Google-Extended,也不影响被纳入Google搜索的AI Overviews、AI模式,但可能影响Gemini应用与Vertex AI中的接地。反过来,过去把AI相关机器人一并屏蔽的站点,值得确认是否连搜索用机器人也被殃及。以用户操作为起点的访问,各家处理不同:OpenAI称“robots.txt可能不适用”,而Anthropic称其所有机器人都尊重robots.txt。

补论 — 引用之外的“AI智能体适配”

这已是从搜索/引用再往前一步的话题,但有一个在两家文档中共通出现的新论点。OpenAI的FAQ对其自有浏览器“ChatGPT Atlas”的智能体如何理解页面,作了如下表述。

ChatGPT Atlas uses ARIA tags—the same labels and roles that support screen readers—to interpret page structure and interactive elements.

(ChatGPT Atlas使用ARIA标签——与支撑屏幕阅读器的相同标签与角色——来解读页面结构与交互元素。)

Google的优化指南也说明,浏览器智能体为完成任务会进行“对无障碍树(accessibility tree)的解读”。面向屏幕阅读器的语义化标记与对WAI-ARIA的适配,直接兼作对AI智能体的适配——这表明无障碍适配正被赋予新的实务意义。

小结

  • 三家官方要求的首要条件,是不要在robots.txt中屏蔽搜索用爬虫(OAI-SearchBotClaude-SearchBotGooglebot。除此之外,OpenAI还列出:托管或CDN不得拦截来自公开IP地址的访问。
  • 训练/模型使用的控制(GPTBotClaudeBotGoogle-Extended)可用与搜索用途不同的令牌进行。OpenAI与Anthropic可以做到“拒绝训练、仍被搜索收录”。Google即便拒绝Google-Extended也不影响搜索的AI功能,但可能影响Gemini应用与Vertex AI中的接地。
  • 在任何一家的官方文档中,都不存在保证被引用或名列前茅的手法。OpenAI明言“没有保证名列前茅的方法”,Google也称“不保证收录与投放”。
  • 没有哪一家要求llms.txt等面向AI的特殊文件。Google甚至明确写明“搜索会忽略它们”,并称分块、面向AI的改写、刻意收集不自然的提及也都不必要。
  • 按Google的官方见解,面向生成式AI搜索的优化属于传统SEO的范畴(“still SEO”)。有独特性的非大宗商品化内容与技术上的健全,依然是基础。
  • Anthropic公开的仅有爬虫控制文档,未能找到官方的优化指南(截至2026年7月12日)。

当你为寻找“被AI引用的特殊招数”而找到官方文档时,写在那里的却是朴实得令人意外的内容——允许爬虫、被收录、写出有独特价值的内容。关于传统SEO的基本,我们在《页面显示速度对SEO到底有多大影响》中也依据官方资料作了梳理。

参考资料