生成引擎优化(GEO)批判性综述:2023-2026年文献述评

作者: Olivier Martinez

版本说明:本综述涵盖自开创性论文第一版发布(2023年11月16日)起至2026年7月14日期间公开发表或正式接受的工作。文中对同行评议文章、已接受但尚未展示的工作以及预印本进行了区分。


摘要

生成引擎优化(Generative Engine Optimization, GEO)旨在提升内容在生成式引擎所产生答案中的存在感、被引用概率或影响力。自开创性GEO论文问世以来,该领域迅速扩张,但术语、度量指标和证据标准依然存在异质性。本批判性综述遴选了2023年11月至2026年7月出版窗口内的45项研究(包括一篇在窗口开启后于EMNLP发表的早期预印本)以及相关的检索增强生成(RAG)与评估工作。我们认为,GEO并非单一的排序任务,而是一个跨越搜索激活、抓取与索引、检索、重排与上下文分配、引用、显著性、事实吸收、忠实度及用户行为的随机、部分可观测的管道(Pipeline)。

开创性论文中广受引用的增益在其特定实验设置下是有效的,但前提是源文档已经存在于固定的上下文中;它们既不能确立有机可发现性(Organic Discoverability),也不能确立持久的流量效应。被审查的文献表明:主题相关性和上下文位置是最具可复现性的杠杆;通用启发式方法的迁移效果较差;竞争会侵蚀个体收益;以引用为导向的重写可能会损害检索。商业审计进一步揭示了低源重叠、显著的运行间波动以及持续存在的忠实度差距。

我们贡献了多阶段形式化模型、一个分离了可发现性、引用、吸收和经济成果的可视化向量、证据层级,以及一套基于重复测量、释义、对照、人工验证和多主体干扰的可复现协议。在该文献语料库中,证据是狭隘的:已被检索的内容可以因果性地改变其引用或使用情况,但没有一种被审查的技术显示出对有机可发现性或下游行为具有稳定、纵向、跨平台的因果效应。

关键词: 生成引擎优化;生成式引擎;AI搜索;可见性;引用;归因;RAG;内容优化;因果测量;算法审计。


目录

  1. 引言
  2. 范围与评审方法
    • 2.1 评审类型与截止日期
    • 2.2 检索、筛选与编码
    • 2.3 出版状态与解释谨慎性
    • 2.4 评审局限性
  3. 从生成式引擎到GEO:多阶段形式化
    • 3.1 随机且部分可观测的管道
    • 3.2 可见性向量而非单一排名
    • 3.3 干预的因果估计量
  4. 开创性论文:贡献、结果与实证范围
    • 4.1 论文真正确立的内容
    • 4.2 实质性发现
    • 4.3 结构性局限
  5. 领域演进(2023-2026)
  6. 测量可见性:从提及到效应
    • 6.1 指标层级
    • 6.2 可靠性:重复、释义与时间
    • 6.3 分母与缺失输出
    • 6.4 LLM裁判与人工验证
  7. 影响力技术:哪些经受住了考验,哪些取决于设置
    • 7.1 主题相关性与位置:两个最稳健的因素
    • 7.2 可提取的证据、结构与时效性
    • 7.3 通用启发式方法的泛化能力差
    • 7.4 端到端测试:SAGEO Arena
    • 7.5 合理的建议
  8. 商业引擎:外部可见性、不稳定性与归因
    • 8.1 表面并不共享相同的源
    • 8.2 激活与查询配置文件
    • 8.3 引用既不暗示信誉也不暗示支持
    • 8.4 从识别到发现
    • 8.5 流量与转化:最薄弱的证据
  9. 竞争、操纵与防御
    • 9.1 技术连续体与规范边界
    • 9.2 商业系统中操纵的证据
    • 9.3 竞争与干扰
    • 9.4 防御
  10. 批判性综合:文献真正确立了什么
  11. 可复现GEO测量的推荐协议
  • 11.1 在数据收集前定义估计量
  • 11.2 最小析因设计
  • 11.3 统计分析
  • 11.4 质量保证与可复现性
  1. 治理与生成可见性的政治经济学
  2. 研究议程
  • 13.1 连接抓取、索引与生成
  • 13.2 因果测量吸收
  • 13.3 观察人类注意力
  • 13.4 研究个性化、语言与地理
  • 13.5 将漂移作为研究对象
  • 13.6 多主体实验与均衡
  • 13.7 防御与完整性认证
  • 13.8 将可见性连接到价值
  1. 可复现性构件
  2. 结论
  • 附录 A:证据层级
  • 附录 B:核心研究精简矩阵

1. 引言

建立在大语言模型基础上的搜索接口不再仅仅对链接列表进行排名。它们检索文档、提炼文档、用自然语言回答,并可能将引用附加到特定的声明中。这种转变改变了可见性的本质:发布者不再仅仅追求在结果页面上占据一个位置,而是追求被检索、被使用、被引用、在显著段落中亮相,并理想情况下被用户选中。生成引擎优化(Generative Engine Optimization, GEO) 为这一问题赋予了名称和初始实验协议 [Aggarwal et al., 2024]。

其科学意义具有双重性。首先,生成式引擎正成为信息获取的中介。它们的源选择决策分配了注意力、权力和收益。其次,对话式接口使得可见性的分配比传统排名更不透明:同一个源可能缺席、被引用但未被使用、在没有链接的情况下被改写,或者在塑造答案结构时起到决定性作用。因此,仅凭提及频率是不够的。

然而,关于GEO的商业宣传进展快于证据。开创性论文中高达40%的数据经常被重新包装为在ChatGPT中排名前列的一般承诺,尽管它描述的是在一个模拟器中的相对可见性增益——在该模拟器中,五个文档已经放入了上下文中。相反,Puerto等人 [2025] 的相反发现在某些情况下被当作对GEO的驳斥,尽管他们评估的是跨多个领域和多个主体的不同结果。一旦区分了管道的各个阶段和因果估计量,这两类证据就可以调和。

本综述提出四个命题:

  1. GEO是多阶段的。 可发现性、上下文中的排名、引用、显著性、吸收和流量是不同的变量。一项干预可能会改善某个阶段而损害另一个阶段。
  2. 可见性是一个分布。 它取决于引擎、日期、位置、查询公式、搜索是否实际激活以及生成过程中的随机性。点估计并非稳定的指标。
  3. 证据主要以检索为条件。 实验提供了强有力的证据,表明已经检索到的文档可以改变答案。但它们很少能证明页面会被有机检索到,几乎从不证明它会对转化产生持久影响。
  4. 优化和操纵共享一个通道。 有用的改写、对抗性序列和间接提示注入都修改了引擎消耗的文本。规范的区别应在于真实性、语义保持、披露以及没有隐藏指令,而不仅仅是可见性的目标。

我们的贡献包括:对45项研究的结构化综述;管道的形式化;指标和干预的分类法;对来自商业引擎证据的批判性评估;将竞争优化、安全和创作者经济联系起来的阐述;以及最终的最小测量协议和研究议程。


2. 范围与评审方法

2.1 评审类型与截止日期

本文是一篇批判性范围综述(Critical Scoping Review),而非临床意义上的系统性综述。该领域尚未收敛到一个稳定的词汇表,许多研究仍仅以预印本形式存在,且所研究的系统在出版周期内不断变化。因此,我们的目标是绘制研究格局图,评估推导的强度,并提出一个累积框架,而不声称对无法比较的效应量进行元分析。

主要的评审窗口始于Aggarwal等人 [2024] 的首个arXiv版本发布日期(2023年11月16日),止于2026年7月14日。我们纳入了Liu等人 [2023a],其预印本早于该起始点,但其在EMNLP会议论文集上的发表(2023年12月)在该日期之后出现。这项研究为引用忠实度提供了重要的同期基准。

2.2 检索、筛选与编码

检索范围涵盖arXiv、ACM数字图书馆、ACL文集、NeurIPS文集、PMLR和OpenReview,随后对核心研究进行向后和向前的引文检索。检索词族包括生成引擎优化、答案引擎优化、对话式SEO、AI搜索可见性、引用吸收、排名操纵、AI Overview引用以及商业引擎名称。

如果一项研究满足以下至少一个标准,则被纳入:

  • 它定义或评估了针对源的检索、排名、引用、提及或影响力的干预;
  • 它测量商业生成式引擎中的源可见性、稳定性、忠实度或集中度;
  • 它研究直接涉及对话式引擎对文档排名或使用的攻击或防御;
  • 它将生成可见性分布所产生的激励和外部性形式化。

关于RAG的通用工作被排除在外,除非它贡献了一个直接必要的指标,例如子问题覆盖率 [Xie et al., 2025]。每项研究都按出版状态、管道阶段、系统是受控的还是商业的、测量单位、主要发现以及最重大的有效性威胁进行了编码。完整的矩阵和检索协议的追溯记录作为arXiv的辅助文件提供;精简版载于附录。

2.3 出版状态与解释谨慎性

本语料库结合了同行评议文章、已正式接受但即将出版的论文、研讨会论文以及预印本。这种区别是实质性的,而非表面上的。截至2026年7月14日,Grossman等人 [2026] 和Vishwakarma等人 [2026] 的研究已被SIGIR 2026接受,但会议于7月20日开始;因此它们被描述为即将出版。几项著名的测量研究尚未经过同行评议 [Schulte et al., 2026, Zhang et al., 2026b, Xu et al., 2026, Allaham and Diakopoulos, 2026]。我们在它们补充已发表发现的地方使用其数据,但不赋予它们相同的证据权重。

2.4 评审局限性

该领域的快速发展带来了稿件、其审计的产品以及读者可用接口之间不匹配的风险。商业名称也掩盖了不同的配置:接收URL的API、配备网页工具的模型以及面向消费者的接口并非同一个系统。最初的检索并未保留特定数据库的命中次数或完整的排除分类账;辅助协议记录了这一限制,而不是重建不可用的数据。最后,任务的异质性排除了对百分比增益的有意义聚合。因此,我们的综合强调效应的方向、其条件及其证据水平,而不是一个人为的平均值,并且任何关于缺失的声明都局限于被审查的语料库中。


3. 从生成式引擎到GEO:多阶段形式化

3.1 随机且部分可观测的管道

令 \(q\) 表示查询,\(u\) 表示用户状态(语言、位置、历史、账户),\(e\) 表示引擎,\(t\) 表示时间点,\(W_{t}\) 表示可访问的网络,\(\epsilon\) 表示随机性项。引擎可能首先决定是否激活搜索:

\[ A = g_{act}(q, u, e, t, \epsilon_{A}) \in \{0, 1\} \]

(1)

如果搜索被激活,引擎检索一个集合 \(R\) 并对其进行排名或重排:

\[ R = g_{ret}(q, u, W_{t}, e, R), \quad \pi(R) = g_{rank}(q, R, u, e, t, \epsilon_{R}) \]

(2), (3)

生成器从上下文窗口 \(\pi(R)_{1:k}\) 中产生答案 \(Y\) 和一组引用 \(C\):

\[ (Y, C) = g_{gen}(q, \pi(R)_{1:k}, e, t, \epsilon_{Y}) \]

(4)

随后,用户可能会阅读答案、点击链接、完成转化或忽略它。内容创作者通常无法观察到完整的集合 \(R\)、重排分数或生成器的内部状态。因此,GEO是一个在不完全信息下的黑盒优化问题。

3.2 可见性向量而非单一排名

对于源 \(s\),我们提出以下向量:

\[ V_{s} = (D_{s}, K_{s}, C_{s}, P_{s}, H_{s}, F_{s}, B_{s}) \]

(5) 其中:

  • \(D_{s}\) 是检索概率,即可发现性(Discoverability)
  • \(K_{s}\) 描述上下文中的暴露度(排名、top-k包含、分配的Token);
  • \(C_{s}\) 是提及或引用的概率;
  • \(P_{s}\) 是可观测的显著性(位置、重复、归因份额);
  • \(H_{s}\) 是吸收(Absorption),即源对答案的事实、语言或结构的有效贡献;
  • \(F_{s}\) 是忠实度(Fidelity),即归因声明实际得到支持且渲染准确的程度;
  • \(B_{s}\) 是行为或经济结果(点击、引荐、转化、价值)。

只有当权重 \(w\) 对应于明确的目标时,标量分数 \(M_{s} = w^{\top}V_{s}\) 才是可辩护的。在没有效用模型的情况下聚合提及、准确引用和转化只会掩盖规范选择。此外,\(D_{s}\) 和 \(C_{s}\) 应分别报告:高条件引用概率 \(Pr(C_{s}=1 | s \in R)\) 无法弥补低检索概率。

3.3 干预的因果估计量

令 \(T\) 为文档 \(d_{s}\) 的转换,令 \(m\) 为指标。感兴趣的平均处理效应(Average Treatment Effect)为:

\[ \tau(m) = \mathbb{E}[m(Y(T(d_{s}))) - m(Y(d_{s}))] \]

(6) 其中查询、引擎、语料库、上下文顺序和时机受到控制或随机化。这一符号突出了三个挑战。首先,未经配对的前后比较将处理与生成过程中的随机性混为一谈。其次,保持 \(R\) 固定估计的是以检索为条件的效应,而不是对整个管道的总效应。第三,违反了无干扰假设:当一个源获得归一化份额时,另一个源就会失去它;当所有竞争者都在优化时,一个主体的处理会改变其他主体的结果。


4. O. 开创性论文:贡献、结果与实证范围

4.1 论文真正确立的内容

Aggarwal等人 [2024] 引入了三个至今仍构 the field 的元素。他们命名了这一现象,将生成式引擎建模为检索和合成的组合,并提出了适合分散在文本中引用的指标。他们的 GEO-bench 包含从几个数据集中抽取的 10000 个查询。对于每个查询,将前五个谷歌结果提供给 GPT-3.5-turbo;在温度 0.7 下生成五个答案。每个源在九种替代策略下进行修改,然后与其原始版本进行比较。

指标包括:(i) 词数(Word Count),归属于某个源的词数份额;(ii) 位置调整词数(PAWC),对出现在答案后部的段落进行打折;(iii) 主观印象(Subjective Impression),一种受 G-Eval 启发由 LLM 做出判断的指标 [Liu et al., 2023b]。五个源分配到的份额总和为 1。因此,可见性本质上是相对的和再分配的。

高达 40% 的数字主要源于**引用添加(Quotation Addition)**下 PAWC 从 19.3 增加到 27.2,按相对值计算约为 41%。主观印象的最大增益较低。这一结果并不意味着多出 40% 的读者会点击,也不意味着页面在检索概率上会增加 40%。这意味着在此测试台中,已经提供给生成器的源获得了更大比例的、按位置加权的归因文本份额。

[激活] -> [抓取 / 索引] -> [检索] -> [重排 / 上下文] -> [生成 / 引用] -> [吸收 / 忠实度] -> [注意力 / 点击 / 转化]

图 1:因果可见性管道。大多数 GEO 研究优化上下文分配和引用之间的阶段;很少有人观察抓取、有机检索或用户行为。

4.2 实质性发现

有三个观察结果在后续文献中经受住了考验。首先,关键词堆砌(Keyword stuffing)无法从传统 SEO 中有效迁移。其次,可直接提取的信息——数字、定义、引文和参考资料——可以促进文档的使用。第三,效应取决于领域和初始排名。在**引用源(Cite Sources)**策略下,第五个源增长了 115.1%,而第一个源损失了 30.3%,说明了该指标的竞争性质。

Perplexity 测试提供了有用但有限的验证:它包括 200 个示例,文本作为文件上传,而不是有机检索的网页。报道的最大增益在 PAWC 上达到 22%,在主观印象上达到 37%。因此,它是对文档使用的黑盒测试,而不是对生产环境中抓取或排名的实验。

4.3 结构性局限

主要的局限性并非论文中的错误;相反,它们定义了其留待解决的议程:

  • 源已经存在于五文档上下文中,因此 \(D_{s}\) 和 \(K_{s}\) 的大部分是固定的;
  • 在没有用户研究的情况下,PAWC 假设较早的引用会受到更多关注;
  • 主观裁判是来自同一模型系列的 LLM,其校准不良的分数被重新归一化到 PAWC 分布中;
  • 添加统计数据或参考资料的干预不受严格的真实性约束;
  • 未观察到点击、引荐、流量或购买;
  • 引擎和基准是快照,而部署的产品变化迅速。

因此,该论文的持久贡献与其说在于提供了一个秘方,不如说在于将商业直觉转化为一个实验问题。随后的文献可以被解读为对该论文将归纳在“印象”之下的变量的渐进式分解。


5. 领域演进,2023-2026

表 2 展示了 GEO 研究的四个连续转变:

期间 中心问题 代表性研究 概念转变
2023-2024 源能否获得可见性? Aggarwal et al. [2024]; Wan et al. [2024] 从排名链接到答案份额;首次受控干预
2024-2025 排名和推荐能否被操纵? Pfrommer et al. [2024]; Nestaas et al. [2025]; Kumar and Lakkaraju [2024] 检索到的内容成为攻击面;白帽/对抗性区分
2025-2026 启发式方法在竞争下能否泛化? Puerto et al. [2025]; Qian et al. [2025]; Chen et al. [2025a] 相反证据、多主体拥堵和跨引擎差异
2026及以后 我们如何测量整个管道并学习优化策略? Kim et al. [2026]; Liu and Xu [2026]; Kirsten et al. [2026]; Schulte et al. [2026] 阶段特定优化、吸收指标、纵向审计与治理

6. 测量可见性:从提及到效应

6.1 指标层级

文献使用“可见性”一词来指代至少九种不同的量。表 3 按从最容易观察到的信号到与用户价值最紧密结合的结果对它们进行了排序。每个级别都解决一个不同的问题,并拥有自己的分母。

Liu等人 [2023a] 的引用召回率(Citation Recall)指标测量了得到充分支持的可验证句子的份额;引用精确度(Citation Precision)测量了正确支持与其相关联的句子的引用的份额。在 Bing Chat、Neeva AI、Perplexity 和 YouChat 中,只有 51.5% 的句子得到了充分支持,74.5% 的引用支持了与其相关联的主张。这些指标评估的是引擎的忠实度,而不是发布者的可见性,但它们强加了一个必要的约束:可见的引用可能是不正确的。

覆盖率指标解决了另一个限制。响应可能会引用许多域,同时省略重要的子问题。Xie等人 [2025] 将复杂的信息需求分解为子问题;Huang等人 [2026] 区分了源的数量与摘要原子内容单元中反映的被引用源内容的比例。这一系列的指标使可见性更接近信息效用。

最后,Zhang等人 [2026b] 提出的“吸附/吸收(Absorption)”概念区分了选择与贡献:ChatGPT 可能会引用较少的源,同时对每个源依赖更深,而 Google 或 Perplexity 则更广泛地分发其引用。这个概念很有成效,但公开的分数结合了位置、重复、覆盖率和文本相似度。它并未揭示内部因果追踪。一个真正的吸收度量理想情况下需要有和没有该源的匹配消融,然后分析改变的事实和表述。

6.2 Reliability: Repetition, Paraphrase, and Time

生成式引擎作为实验只有在分布层面上才是可重复的。即使报告的温度为零,也无法固定索引、检索或外部服务的版本。在四个引擎和 45 天的时间里,Schulte等人 [2026] 观察到每日源级 Jaccard 得分约为 0.34-0.42,24 小时内的重复项也有类似的水平。他们提出将七到八次重复作为提示的起点。这个数字并非通用标准:它源于一小批瑞士查询和最多十次重复。适当的做法是顺序精度分析:重复测量,直到估计量周围的区间对当前决策足够窄。

同行评议的审计证实了这一现象。Kirsten等人 [2026] 分析了美国和德国几个界面上的 4706 个查询。两个月内的页面重叠度,对于 AI Overviews 为 18%,而传统的 Google 搜索则为 45%;在可以控制温度的界面上,温度为零时的重复运行改变了 9-28% 的决策。Grossman等人 [2026] 同样发现,微小的重新表述对 AIO 源的改变大于传统搜索返回的源。因此,GEO 测量必须沿至少四个维度变化:运行、释义、日期和引擎。

6.3 分母与缺失输出

丢弃没有搜索或引用的响应会产生选择偏差。在 Schulte等人 [2026] 研究的配置中,57.8% 的 ChatGPT 重复项未激活网络搜索。仪表盘不能仅在包含引用的响应中计算“引用份额”,然后将其解释为整体可见性。它必须进行分解:

\[ Pr(s \text{ cited}) = Pr(A=1) \times Pr(s \in R | A=1) \times Pr(s \text{ cited} | s \in R, A=1) \]

(7) 这个简单的恒等式解释了为什么高条件引用率可以与低商业可见性共存。

URL 规范化(Canonicalization)也至关重要。参数、重定向、锚点、AMP 版本、翻译页面和聚合器可以人为地分散域。研究应公布其解析规则并保留原始 URL、最终 URL、可注册域,并在可能的情况下保留检索到内容的哈希值。

6.4 LLM裁判与人工验证

LLM 裁判使得评估数万个声明成为可能,但它们引入了模型依赖性、风格偏差和循环论证。当同一个模型生成重写、响应和评分时,风险最大。稳健的评估应:

  1. 分离生成器和裁判模型系列;
  2. 对裁判屏蔽实验条件;
  3. 随机化变体的顺序;
  4. 在分层人类样本上验证每个维度;
  5. 报告一致性、敏感性、特异性和分歧模式,而不仅仅是整体相关性;
  6. 保留不依赖于裁判的可观察指标,例如规范引用或点击。

Xu等人 [2026] 报告他们的验证器在手动评估的样本上准确率为 95.6%,这增强了他们的发现,尽管无法访问的视频或社交媒体页面仍然难以评估。Vykopal等人 [2026] 同样在其基础性分析的部分使用了自动化评估器。这些研究指明了正确方向:裁判可以作为测量工具,而不是未经检查的真理来源。


7. 影响力技术:哪些经受住了考验,哪些取决于设置

7.1 主题相关性与位置:两个最稳健的因素

查询-文档相关性是最具可复现性的因素。在 ConflictingQA 中,Wan等人 [2024] 使用反事实干预表明,模型强烈偏爱与问题的显式对齐,通常超过诸如科学参考或中立语调等人类信誉线索。这一结果并不意味着信誉无关紧要;它表明在相互冲突的证据和有限的上下文中,模型首先遵循看起来直接回答问题的内谷。

上下文中的排名同样具有重要后果。Puerto等人 [2025] 发现,将源在上下文中提升具有比大多数重写更大的效应。Vishwakarma等人 [2026] 包含 252000 次试验、涉及六个 LLM 和十八个因素的析因实验,确定了相关性和位置是首次引用的主要决定因素。这一发现将 GEO 重新导向上游阶段:一个在 top-k 中缺席的完美表述页面无法做出贡献。

7.2 可提取的证据、结构与时效性

统计数据、定义、比较、价格、日期和参考资料具有明显的优势:它们构成了生成器可以选择和归因的单元。开创性论文、AutoGEO 和 FeatGEO 观察到这些属性中的几个具有积极效应 [Aggarwal et al., 2024, Wu et al., 2026c, Liu and Xu, 2026]。Vishwakarma等人 [2026] 的对照实验发现了显式价格和最新日期的效应,而单独的格式变化效应较弱。

需要两点限定。首先,效应取决于意图。最近的日期有助于时间敏感的查询,但不一定有助于稳定的定义。引文可能有助于回答历史问题,但却会拖累产品列表。其次,添加虚构的统计数据可能会增加重用,同时降低认知质量。因此,标准不是“添加数字”,而是提供相关的、可验证的、有日期的且正确归因的证据。

HTML 和文档结构开始被单独研究。Yu等人 [2026] 报告了与某些结构特征相关的增益,但该工作的预印本状态和对自动化裁判的依赖需要谨慎。SAGEO Arena 提供了一个更有启示性的结果:结构字段可能会改善检索,而不一定在重排或引用阶段产生相同的效应 [Kim et al., 2026]。结构应该逐个阶段进行评估,而不是被视为通用的护身符。

7.3 通用启发式方法的泛化能力差

C-SEO Bench 提供了主要的实证校正。在两个任务、六个领域、大约 1900 个查询和 16360 个文档中,54 种方法-领域组合中只有三種在主实验中显著为正;在问答中没有一种为正 [Puerto et al., 2025]。一些转换甚至降低了排名。随着采用率的增加,收益下降,最终产生接近零和博弈的拥堵动力学。

E-GEO 在电商领域得出了兼容的结论:十五种初始启发式方法中有十种是中立的或负面的,而系统优化的提示表现更好;作者报告了一个相对稳定、与领域无关的结构 [Bagga et al., 2025]。近期的优化系统——AutoGEO、FeatGEO、Mind Reader、IF-GEO 和 MAGEO——用学到的规则、意图分解、多重目标或策略记忆取代了固定的配方 [Wu et al., 2026c, Liu and Xu, 2026, Chen et al., 2026, Zhou et al., 2026, Wu et al., 2026a]。它们有时能实现实质性增益,但候选文档集通常提前固定,且推理成本仍然很高。

7.4 端到端测试:SAGEO Arena

SAGEO Arena 至关重要,因为它恢复了检索和重排。在 171003 个文档和 2700 个查询中,仅正文优化使平均前 20 名的存在度降低了约 9%,重排后前 10 名的存在度降低了 16%,最终引用降低了 6% [Kim et al., 2026]。将 AutoGEO 仅应用于正文可能会产生更大的损失。因此,重写在注入时可能表现良好,但会使文档在上游更难检索或更不具竞争力。

这一结果解决了一个明显的矛盾。固定上下文基准估计对生成的直接效应:SAGEO 估计几个效应的合成。如果 \(T\) 增加了 \(Pr(C_{s}=1 | s \in R)\) 但减少了 \(Pr(s \in R)\),则总效应可能是负面的。任何运营主张都必须具体说明它测量了这些效应中的哪一个。

7.5 合理的建议

得到最多支持的建议是保守的:生成一个相关、全面、可验证、结构清晰且技术上可检索的页面;然后分别测量检索、检索、引用和忠实度。这种策略更类似于高质量的信息工程,而不是关键词操纵。


8. 商业引擎:外部可见性、不稳定性与归因

8.1 表面并不共享相同的源

审计一致发现低重叠度。在总共 1008 个响应的三系统审计中,对 672 个 Bing Chat 和 Perplexity 响应的阶段特定分析确定了 355 个唯一域,其中 26% 被两个系统引用 [Li and Sinnamon, 2024]。Kirsten等人 [2026] 观察到,Google AIO 引用的域中有 53% 未出现在有机前 10 名中,27% 缺席前 100 名。在 11500 个查询中,Grossman等人 [2026] 报告了有机 Google、AIO 和 Gemini 之间的 URL 级 Jaccard 相似度为 0.11-0.18。

这些结果反驳了全球 GEO 排名的概念。可见性由引擎和界面索引。在传统 SERP 中可见的站点可能会在 AIO 中缺席;Perplexity 引用的域可能永远不会出现在 ChatGPT 中。因此,任何策略和指标都必须识别所研究的产品、搜索模式和时期。

8.2 激活与查询配置文件

显示生成响应的概率很大程度上取决于查询形式。Xu等人 [2026] 分析了 40 天内的 55393 个趋势查询:总体 AIO 激活率为 13.7%,但对于表述为问题的查询上升至 64.7%。Grossman等人 [2026] 在其代表性样本中观察到 51.5% 查询的 AIO。这些数字并不矛盾:查询、日期和分类的分布不同。它们精确说明了为什么在没有样本描述的情况下报告的比率具有有限的迁移性。

8.3 引用既不暗示信誉也不暗示支持

引用忠实度的基础审计已经证明了表象与支持之间的差距 [Liu et al., 2023a]。在 2026 年,Vykopal等人 [2026] 观察到可信源份额为 71.4-86.3%,具体取决于助手和主题,某些 GPT 配置中的错误信息源多于 Perplexity 或 Qwen。Xu等人 [2026] 将 98020 个原子声明中的大约 11% 分类为支持不足,受制于检索和裁决的局限性。Allaham和Diakopoulos [2026] 报告称,成功检索并分类的 19154 个文本文档中,大约 16% 被选定的检测器标记为 AI 生成;27.1% 的 URL 未被抓取,因为它们无法访问、已被删除或属于非文本。

因此,绝不应在独立于 \(F_{s}\) 的情况下最大化可见性。源可能会因其不支持的主张而被引用、被负面使用或嵌入合成内容反馈循环中。审计应将引用率与涵盖语调、归因准确性和事实支持的矩阵配对。

8.4 从识别到发现

Sharma [2026] 区分了 112 家初创公司的名称识别(Name Recognition)与类别级发现(Category-level Discovery)。在他们的协议中,ChatGPT 在命名时能识别 99.4% 的产品,但在有机发现查询中仅浮现了 3.32% 的产品;Perplexity 从 94.3% 下降到 8.29%。这些数字来自使用两个模型的单研究预印本,但这种区别是根本性的。在模型权重中编码实体或通过名称检索它,并不意味着推荐它用于通用意图。

Chen等人 [2025a] 关于赢得媒体(Earned Media)过度代表的观察应在此背景下阅读:第三方提及可能会扩展可检索证据的生态系统。该研究仍然是观察性的且由行业支持;它并未表明获得外部曝光机械性地导致推荐。尽管如此,它表明 GEO 的相关单位可能是一个源网络,而不是孤立的页面。

8.5 流量与转化:最薄弱的证据

极少数研究观察了 \(B_{s}\)。Watanabe和Nakayashiki [2026] 分析了某个网站的日志,该网站的某些页面接受了 AEO 干预。随着平台增长,总的 ChatGPT 引荐量增加了 5.7 倍,但未处理的页面已经增加了 3.5 倍。对照时间序列分析估计了额外的 1.82 倍乘数,95% 区间为 [1.31, 2.54],而保守的时间安慰剂产生了 \(p=0.16\)。因此,效应更多是提示性的,而非因果确立的。

Zhang等人 [2026a] 的行业研究报告称,在大规模部署 VLM 代理框架后,生产流量比对照组提升了 20%。这是罕见的生产证据,但群组大小、分配单位、统计不确定性和干预的组成部分并未进行足够详细的描述以支持通用估计。在此阶段,关于 GEO 投资回报率的主张明显超越了学术证据。


9. 竞争、操纵与防御

9.1 技术连续体与规范边界

白帽优化和对抗性攻击共享公式 (6) 中的数学目标。区分它们的不是它们是否施加了影响,而是强加给 \(T\) 的约束。我们提出四个累积测试:

  1. 语义保持:事实和资质是否保持真实?
  2. 证据真实性:统计数据、评论和参考资料是否可验证?
  3. 内容-指令分离:文档是通知用户还是向模型发出隐藏命令?
  4. 披露与公平:商业意图是否披露,竞争对手的代表是否没有虚构的贬低?

重组段落或添加经过验证的主要源通常会满足这些测试。模型导向的序列、虚构的证词或赞成某种品牌的指令将违反它们。这个框架防止了重写仅仅因为它流畅就被分类为“白帽”。

9.2 商业系统中操纵的证据

Pfrommer等人 [2024] 表明,对文档的间接注入可以在 Perplexity Sonar Large Online API 上将目标提升大约三个排名。由于 URL 是显式提供的,证据涉及检索后阶段。Nestaas等人 [2025] 提供了跨多个系统发布的最强有力的证明:例如,他们的偏好操纵攻击将虚构相机的推荐率从 34.0% 提高到 59.4%,而某些插件选择甚至增加了多达 7.2 倍。产品自此之后有所演进,页面也是受控的,但漏洞的存在得到了确立。

对排名器的研究强化了这一诊断。Qian等人 [2025] 识别了一个决策盲点,而 Xing等人 [2026] 优化了在保持相对自然的同时推广项目的短后缀。StealthRank 联合追求排名和隐蔽性,但其主要状态是带有研讨会版本的预印本,而不是常规的 ICML 出版物 [Tang et al., 2025]。CORE 报告了跨四个模型系列的高 Top-1 成功率,但以 JSON 格式向排名器传递了十个产品的固定检索列表,始终将目标放在最后,并且可以生成虚构的评论 [Jin et al., 2026]。它测量的是重排操纵,而不是有机发现。

9.3 竞争与干扰

当印象份额总和为 1 时,GEO 至少在局部是再分配的。C-SEO Bench 表明,随着采用率的增加,收益可能会侵蚀 [Puerto et al., 2025]。Nestaas等人 [2025] 的互补多攻击者实验证明了检索后干扰,但并未建立有机网络均衡。Hu [2025] 将攻击选择建模为无限重复的囚徒困境,并研究了合作的条件。在一个不同的框架中,Wu等人 [2026b] 对创作者之间的竞争进行了建模,并在其假设下表明,引用和补偿可以维持内容生产的努力。

这种干扰使单主体评估作为均衡结果的预测失效。研究应包括几个饱和水平——例如,处理 0%、25%、50%、75% 和 100% 的文档——并估计直接效应和溢出效应。否则,一旦该策略变得普遍,最初的个人收益可能会降为零。

9.4 防御

防御不能局限于过滤几个可疑词。在 GEO-BENCH 中,在大多数配置中,对抗性攻击仍然可以被两个代理中的至少一个检测到;然而,某些黑盒白帽重写在某些领域逃避了词汇过滤器和困惑度代理 [Nimase et al., 2026]。GRADA 使用文档间关系进行重排,并将某些攻击的成功率降低了多达约 80%,而准确率仅有有限的损失 [Zheng et al., 2025]。引擎还应将指令与检索到的内容分开;限制授予文档的权威;比较多个独立源;检测利益冲突和不可验证的证据;保留归因日志;按主体类别审计效应。

尽管如此,防御产生了一个分布问题。过于严格的反推广过滤器可能会惩罚合法描述其产品的微型发布者,而宽容的过滤器则有利于能够产生大量内容的行动者。因此,必须将有效性与误报、源多样性和对竞争的效应结合起来评估。


10. 批判性综合:文献真正确立了什么

最重要的结论涉及范围。证据对于以上下文为条件的因果效应是强大的,对于某些信息属性是中等的,对于通过流量的传输是微弱的。这种梯度解释了为什么从业者可能会观察到成功案例,尽管文献并不保证一般的承诺。

第二个结论涉及目标。负责任的优化不仅最大化 \(C_{s}\) 或 \(P_{s}\)。它寻求在可发现性、效用、忠实度、成本、稳定性和公平性之间的帕累托前沿。Feat GEO 和几种代理方法朝着这个方向发展,但它们的指标在很大程度上仍然是自动化的 [Liu and Xu, 2026, Yuan et al., 2026]。未来的评估单位应该是一个受真实性约束的多目标政策,而不是赢得引用竞赛的文本。


11. 可复现GEO测量的推荐协议

11.1 在数据收集前定义估计量

研究必须说明其目标是:(i) 文档注入后重写的条件效应;(ii) 可复现管道中的总效应;(iii) 与商业表面的观察关联;或 (iv) 生产中的商业结果。混淆这些估计量会产生无效的结论。必须预先指定主要指标、分母、排除项以及具有实质意义差异的阈值。

11.2 最小析因设计

我们建议交叉以下因素:

  • 多个命名的引擎和搜索模式,带有版本和日期;
  • 多个意图和领域,分别进行分析;
  • 每个信息需求三到五个释义;
  • 紧密间隔的重复和多个时间窗口;
  • 未处理的基线、干预,以及在可能的情况下,长度相当的安慰剂;
  • 随机或平衡的上下文顺序;
  • 存在竞争对手时的多个采用率。

根据 Schulte等人 [2026],七到八次重复构成了合理的起点,但试点研究应估计方差。然后可以为所需的置信区间赋能主要数据收集。没有搜索、没有引用或带有错误的输出是结果,而不是要丢弃的数据。

11.3 统计分析

查询、源和日期是聚类单位。将所有世代测试为好像它们是独立的,低估了不确定性。对于二元引用结果,一种可能的分层模型是:

\[ \text{logit } Pr(C_{iqetr} = 1) = \beta_{0} + \beta_{1}T_{i} + b_{q} + b_{e} + b_{t} + b_{s} + \gamma^{\top}X \]

(8) 其中 \(b_{q}\)、\(b_{e}\)、\(b_{t}\)、\(b_{s}\) 捕获查询、引擎、日期和源,\(X\) 包含预先指定的因素。对于比例或排名,优选合适的模型或查询-源级别的集群自助法(Cluster Bootstrap)。研究应报告绝对效应、相对效应、区间和分布,而不仅仅是平均值。

在生产中,跨页面或时期的随机化是理想的。当这不可行时,双重差分(Difference-in-Differences)、中断时间序列和合成控制可以提供帮助,但必须检查平行趋势和安慰剂测试。Watanabe和Nakayashiki [2026] 的研究说明了对照的重要性:大量的原始增长可能产生于平台增长。

11.4 质量保证与可复现性

在遵守适用的使用条款的前提下,协议应保留提示、原始响应、引用、搜索状态、时间戳、区域设置、账户类型、用户代理和规范化规则。分层人类样本应验证引用归因、声明支持、情感、重写下的事实保持以及裁判错误。敏感或受保护的数据可以发布为哈希、元数据和重构脚本。


12. 治理与生成可见性的政治经济学

GEO 重新分配了一种资源:注意力。随之产生三个风险。首先,引擎可能会将引用集中在少数几个域上并制造进入壁垒。其次,赞助或优化的内容可能会影响答案,而没有相当于传统广告所需的披露。第三,如果生成的摘要替代了点击,创作者可能会减少对产生原始源的投资。

Wu等人 [2026b] 对用户体验、引用、内容生产努力和补偿之间的权衡进行了建模。他们的结论取决于理论模型,但他们正确地构架了问题:引用不仅仅是一个忠实度指标;它是激励机制的一部分。Wen等人 [2026] 认为,治理应解决学术研究与行业实践之间的集中度、披露和盲点。

随之而来的是几个运营原则:

  • 披露可能影响推荐的商业关系;
  • 使发布者能够检查或质疑不正确的归因;
  • 发布源集中度和多样性的汇总审计;
  • 默认将间接指令视为不受信任的内容;
  • 在没有事实支持约束的情况下不奖励引用指标;
  • 共同研究补偿、许可和流量,而不是分开研究。

监管应针对机制和激励,而不是冻结“符合 GEO”的格式。引擎的演进太快,不适合纯粹的技术分类法,而关于真实性、披露和补救途径的标准则更稳定。


13. 研究议程

13.1 连接抓取、索引与生成

优先级是一个基准,其中修改的页面必须实际被抓取、索引、检索、重排然后引用。SAGEO Arena 为此方向提供了可复现的步骤,但将分析扩展到商业系统需要现场协议、索引延迟和受控页面。内容修改、内部链接、结构化数据、域声誉和爬虫可访问性必须分开。

13.2 因果测量吸收

必须对照有和没有该源的干预、原子事实单元以及在可用时引擎提供的归因追踪来验证复合吸收得分。问题不仅在于“哪个文本类似于页面?”,还在于“在其缺席下哪个声明或决策会改变?”

13.3 观察人类注意力

PAWC 假设答案的开始吸引更多注意力。使用眼动追踪、点击、回忆和选择的实验可以估计经验位置权重。它们应包括移动响应、语音输出、对话模式以及由引用引起的信任效应。

13.4 研究个性化、语言与地理

大多数研究使用英语、匿名账户和少数位置。Kirsten等人 [2026] 观察到的美国和德国之间的重叠差异激发了多语言和多区域面板。研究还必须区分本地源的缺席与引擎偏差。

13.5 将漂移作为研究对象

研究不应将引擎更新视为麻烦,而应测量漂移机制:突变、季节性、引用老化和策略转移。一个活的基准应该版本化提示、快照和页面内容,而不是发布一个所谓的永恒分数。

13.6 多主体实验与均衡

研究应随机化采用率并检查对小型发布者、大型品牌和公共利益源的效应。相关指标包括个人收益、信息福利、集中度、优化成本和后均衡质量。在 10% 采用时有用但在 100% 时有害的策略不能在没有限定的情况下被推荐。

13.7 防御与完整性认证

对攻击的研究必须与负责任的披露约束相结合,并评估误报的防御。标准可以证明转换保留了事实、保留了源、不添加模型导向的指令并且对用户保持可读。认证不能保证排名;它将保证优化过程的完整性。

13.8 将可见性连接到价值

与发布者和引擎的伙伴关系对于连接 \(D_{s}\)、\(C_{s}\)、\(H_{s}\) 和 \(B_{s}\) 是必要的。随机试验不仅应测量点击,还应测量流量质量、转化、满意度和替代效应。没有这种联系,GEO 具有优化装饰性引用的风险。


14. 可复现性构件

随附的 arXiv 源包包含 LaTeX 手稿、BibTeX 参考文献、45 项研究的详细 CSV 矩阵,以及数据库、查询家族、去中心化规则和评审局限性的追溯 CSV 记录。原始的数据库特定命中次数和完整的排除分类账未被保留,并被明确标记为不可用。带日期的副本也应存档在持久存储库中,因为预印本的出版状态将会改变。


15. 结论

在 2023 年 11 月至 2026 年 7 月期间,GEO 从一组启发式方法演变为关于源选择、归因、吸收和竞争的研究计划。开创性论文正确地识别了一个新的可见性表面,并证明了已经检索到的文档的呈现可以改变其在答案中的份额。然而,后续工作缩小了该结论的范围:通用启发式方法的迁移较差,上下文顺序和相关性通常占主导地位,竞争可以侵蚀测试的多主体设置中的收益,下游优化可能会损害检索。

商业审计同样表明,引擎引用不同的源生态系统,在运行间变化,并且可能会将声明归因于未能充分支持它们的页面。因此,可见性不能简化为“被 ChatGPT 引用”。它必须作为跨多个引擎、提示和时期的向量进行测量,同时保留忠实度指标和零结果。

在被审查的语料库中,得到最多支持的综合既稳健又有限:已经检索到的内容可以因果性地影响答案,而审查没有发现任何技术对有机可发现性或下游点击和转化具有稳定、纵向、跨平台的因果效应。这一限制并没有使 GEO 无效。它定义了将其转变为累积学科而非宣传词汇所需的科学工作。


附录 A:证据层级

表 7:用于分级 GEO 索赔的建议框架。

级别 设计 带有日志和对照的随机现场试验或强准实验 洞察力结论示例 警示
A 随机现场试验或强准实验与日志和对照 所研究设置下的点击、流量或转化的因果效应 -
B 现场商业引擎、重复、释义和多个日期 外部可见性的分布和跨引擎差异 跨产品和时期的可移植性有限
C 带有手动提供 URL 或文件的商业系统 黑盒检索后效应 API/接口配置和个性化可能表征不完全
D 具有检索、重排和生成的标准 RAG 管道 测试台内的阶段特定因果效应和总效应 不建立抓取、索引或有机检索
E 固定上下文、合成排名器或 LLM 裁判 以上下文为条件的可能机制 对现实世界网络可见性的证据薄弱

附录 B:核心研究精简矩阵

表 8:综述中包含的直接相关研究(PEER = 同行评议;FORTHC. = 截至截止日期已接受且即将出版;PREPR. = 预印本;WKSP. = 研讨会)。

研究 状态 主阶段 关键结果或局限性
Aggarwal et al. 2024 PEER 引用/显著性 在五文档上下文中约有 40% 的相对改善;无端到端检索。
Liu et al. 2023 PEER 忠实度 跨四个历史引擎,51.5% 的句子得到充分支持,74.5% 的引用正确。
Li and Sinnamon 2024 PEER 商业源 总体 1008 个响应;在 Bing-Perplexity 阶段,672 个响应中有 26% 的域重叠。
Wan et al. 2024 PEER 影响力 主题相关性在 ConflictingQA 中占主导地位;受控上下文。
Kumar and Lakkaraju 2024 PREPR. 产品排名 战略序列在虚构目录中有效;无商业引擎。
Pfrommer et al. 2024 PEER 检索后攻击 注入可转移到 Perplexity;显式提供 URL。
Nestaas et al. 2025 PEER 商业攻击 对 Bing、Perplexity 和插件的偏好操纵;受控页面。
Narayanan Venkit et al. 2025 PEER 使用/可验证性 定性研究显示引用的实际局限性;3 名试点和 21 名主研究参与者。
Puerto et al. 2025 PEER 竞争 54 个案例中有 3 个积极案例;问答中无;在广泛采用下增益接近零。
Qian et al. 2025 PEER 对抗性排名器 LLM 排名中可利用的决策盲点。
Zheng et al. 2025 PEER 防御 GRADA 在准确率损失有限的情况下大幅降低攻击成功率。
Wu et al. 2026 (AutoGEO) PEER 学习优化 报道的平均改进为 +35.99%,以检索到五个文档为条件。
Chen et al. 2025 (CC-GSEO) PREPR. 影响力/质量 检索到的网络上下文,但 LLM 生成的文章中心查询和主要自动化裁判;无互补的人类验证。
Chen et al. 2025 (audit) PREPR. 商业引擎 赢得媒体过度代表;观察性快照。
Lüttgenau et al. 2025 PREPR. 重写 合成旅游内容的增益;小型外在评估。
Ho et al. 2025 WKSP. 广告检索 PPO 改善了包含度,具有小的绝对 MRR 增益;离线管道。
Bagga et al. 2025 PREPR. 电子商务 十五种启发式方法中有十种中立或负面;系统优化提示表现更好并收敛到与领域无关的结构。
Kim et al. 2026 PREPR. 完整管道 下游重写降低了检索和重排;非商业管道。
Tian et al. 2026 PREPR. 引用诊断 报告了修改 5% 文本的目标修复;语料库不一致。
Yuan et al. 2026 PREPR. 多目标代理 在 GEO-Bench、MS MARCO 和自定义亚马逊派生数据集上使用两个开源权重引擎和固定的五文档列表进行离线测试。
Liu and Xu 2026 PEER 多目标特征 信息特征比词汇特征更有用;成本高且严重依赖裁判。
Chen et al. 2026 (Mind Reader) PEER 潜在需求 获得巨大增益,但生成和评估主要由 LLM 执行。
Zhou et al. 2026 PEER 多个查询 将冲突和下行风险形式化;主流引擎是模拟的。
Wu et al. 2026 (MAGEO) PEER 代理/归因 可重用的策略和忠实度-可见性得分;冻结上下文。
Tang et al. 2025 WKSP. 隐蔽攻击 开源模型上的排名-流畅度权衡;无商业引擎。
Xing et al. 2026 PEER 排名器攻击 短的、自然的后缀推广目标;简化上下文。
Jin et al. 2026 PREPR. 产品排名 报道高的 Top-k 成功率;以 JSON 形式提供十个产品的固定检索列表和可能的虚构评论。
Nimase et al. 2026 PREPR. 攻击基准 在一个排名器上比较攻击和白帽方法;与原始 GEO-bench 同名。
Smirnov 2026 PREPR. 片段 RL 利用比较偏好;模拟概览。
Kirsten et al. 2026 PEER 多表面审计 4706 个查询,低重叠度,且在温度可控的表面上重复决策变化 9-28%。
Grossman et al. 2026 FORTHC. Google 审计 11500 个查询;51.5% 的 AIO;跨表面 Jaccard 低于 0.2。
Xu et al. 2026 PREPR. 纵向 AIO 55393 个查询;13.7% 激活;11% 的声明支持不足。
Allaham and Diakopoulos 2026 PREPR. 合成源 19154 个检索到的分类文本文档中的大约 16%;单检测器和 27.1% 不可访问、删除或非文本。
Schulte et al. 2026 PREPR. 稳定性 可见性作为一种分布;小型瑞士宇宙。
Huang et al. 2026 PREPR. 覆盖率 测量摘要原子内容单元中反映的被引用源内容的比例;过时的 Natural Questions 数据集。
Zhang, He, and Yao 2026 PREPR. 吸收 21143 个引用和 72 个特征;非因果复合分数。
Vishwakarma et al. 2026 FORTHC. 引用因素 252000 次试验;相关性和位置占主导地位;注入了两个文档。
Vykopal et al. 2026 PEER 信誉 基础性和可疑源的差异;受限领域。
Watanabe and Nakayashiki 2026 PREPR. 流量 估计的 ITS 乘数率为 1.82,但安慰剂 \(p=0.16\);单一站点。
Sharma 2026 PREPR. 发现 112 家初创公司的巨大识别-发现差距;两个模型。
Zhang et al. 2026 (Pinterest) PREPR. 生产 报道生产流量比对照提升 20%;因果归因描述不够详细。
Yu et al. 2026 PREPR. 结构 跨六个引擎报告了结构增益;有限的验证。
Hu 2025 WKSP. 理论/竞争 攻击选择的无限重复囚徒困境;结论取决于模型。
Wu et al. 2026 (ecosystem) PREPR. 经济学 创作者竞争模型,其中引用和补偿可以维持努力;模型依赖。
Wen et al. 2026 PEER 治理 关于集中度、披露和学术盲点的立场论文。

参考文献

  1. Aggarwal P, Murahari V, Rajpurohit T, Kalyan A, Narasimhan K, Deshpande A. GEO: Generative engine optimization. Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining, 2024: 5–16. doi:10.1145/3637528.3671900

  2. Allaham M, Diakopoulos N. Synthetic sources? Auditing generative search engine citations for evidence of AI-generated sources, 2026. arXiv:2605.23684

  3. Bagga PS, Farias VF, Korkotashvili T, Peng T, Wu Y. E-GEO: A testbed for generative engine optimization in e-commerce, 2025. arXiv:2511.20867

  4. Chen M, Wang X, Chen K, Koudas N. Generative engine optimization: How to dominate AI search, 2025a. arXiv:2509.08919

  5. Chen Q, Chen J, Huang H, Shao Q, Chen J, Hua R, Xu H, Wu R, Ren C, Wu J. CC-GSEO-Bench: A content-centric benchmark for measuring source influence in generative search engines, 2025b. arXiv:2509.05607

  6. Chen T, Guo J, Li Y, Chen B, Ren H, Zhang Z, Zhang Y, Xia H, Liang K, Fan Z. Mind reader: Latent user demand-guided content optimization for generative search engine. Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, 2026: 40832–40848. doi:10.18653/v1/2026.acl-long.1894

  7. Grossman R, Liu S, Chen MK, Smith M, Borcea C, Chen Y. How generative AI disrupts search: An empirical study of Google search, Gemini, and AI overviews. Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2026. arXiv:2604.27790

  8. Ho C, Singh IS, Sharma D, Anumandla TR, Lu M, Sharma V, Zhu K. Rewrite-to-rank: Optimizing ad visibility via retrieval-aware text rewriting, 2025. arXiv:2507.21099

  9. Hu X. Dynamics of adversarial attacks on large language model-based search engines, 2025. arXiv:2501.00745

  10. Huang M, Goyal A, Saha K, Chandrasekharan E. Answer bubbles: Information exposure in AI-mediated search, 2026. arXiv:2603.16138

  11. Jin H, Chen R, Zhang P, Luo Y, Zeng H, Luo M, Wang H. Controlling output rankings in generative engines for LLM-based search, 2026. arXiv:2602.03608

  12. Kim S, Jeong W, Kim S, Lee S, Lee D. SAGEO Arena: A realistic environment for evaluating search-augmented generative engine optimization, 2026. arXiv:2602.12187

  13. Kirsten E, Perdekamp JG, Wu Q, Upadhyay M, Gummadi KP, Zafar MB. Characterizing web search in the age of generative AI. Findings of the Association for Computational Linguistics: ACL 2026, 2026: 10827–10848. doi:10.18653/v1/2026.findings-acl.526

  14. Kumar A, Lakkaraju H. Manipulating large language models to increase product visibility, 2024. arXiv:2404.07981

  15. Lewis P, Perez E, Piktus A, Petroni F, Karpukhin V, Goyal N, Küttler H, Lewis M, Yih W, Rocktäschel T, Riedel S, Kiela D. Retrieval-augmented generation for knowledge-intensive NLP tasks. Advances in Neural Information Processing Systems, 2020, 33: 9459–9474. NeurIPS 2020

  16. Li A, Sinnamon L. Generative AI search engines as arbiters of public knowledge: An audit of bias and authority. Proceedings of the Association for Information Science and Technology, 2024, 61(1): 205–217. doi:10.1002/pra2.1021

  17. Liu NF, Zhang T, Liang P. Evaluating verifiability in generative search engines. Findings of the Association for Computational Linguistics: EMNLP 2023, 2023a: 7001–7025. doi:10.18653/v1/2023.findings-emnlp.467

  18. Liu Y, Iter D, Xu Y, Wang S, Xu R, Zhu C. G-Eval: NLG evaluation using GPT-4 with better human alignment. Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, 2023b: 2511–2522. doi:10.18653/v1/2023.emnlp-main.153

  19. Liu Z, Xu P. Think before writing: Feature-level multi-objective optimization for generative citation visibility. Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, 2026: 20290–20303. doi:10.18653/v1/2026.acl-long.929

  20. Lüttgenau F, Colic I, Ramirez G. Beyond SEO: A transformer-based approach for reinventing web content optimisation, 2025. arXiv:2507.03169

  21. Nestaas F, Debenedetti E, Tramèr F. Adversarial search engine optimization for large language models. International Conference on Learning Representations, 2025. OpenReview

  22. Nimase O, Chen Z, Qi G, Zhao Y, Hu X. GEO-Bench: Benchmarking ranking manipulation in generative engine optimization, 2026. arXiv:2605.29107

  23. Pfrommer S, Bai Y, Gautam T, Sojoudi S. Ranking manipulation for conversational search engines. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 2024: 9523–9552. doi:10.18653/v1/2024.emnlp-main.534

  24. Puerto H, Gubri M, Green T, Oh SJ, Yun S. C-SEO Bench: Does conversational SEO work? Advances in Neural Information Processing Systems 38: Datasets and Benchmarks Track, 2025. NeurIPS 2025

  25. Qian Y, Zeng Y, Jiang Y, Jain C, Wang H. The ranking blind spot: Decision hijacking in LLM-based text ranking. Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, 2025: 21958–21968. doi:10.18653/v1/2025.emnlp-main.1116

  26. Schulte J, Bleeker M, Kaufmann P. Don’t measure once: Measuring visibility in AI search (GEO), 2026. arXiv:2604.07585

  27. Sharma AP. The discovery gap: How Product Hunt startups vanish in LLM organic discovery queries, 2026. arXiv:2601.00912

  28. Smirnov R. Exploring LLM biases to manipulate AI search overview, 2026. arXiv:2605.00012

  29. Tang Y, Fan Y, Yu C, Yang T, Zhao Y, Hu X. StealthRank: LLM ranking manipulation via stealthy prompt optimization, 2025. arXiv:2504.05804

  30. Tian Z, Chen Y, Tang Y, Liu J, Jia R. Diagnosing and repairing citation failures in generative engine optimization, 2026. arXiv:2603.09296

  31. Venkit PN, Laban P, Zhou Y, Mao Y, Wu CS. Search engines in the AI era: A qualitative understanding to the false promise of factual and verifiable source-cited responses in LLM-based search. Proceedings of the 2025 ACM Conference on Fairness, Accountability, and Transparency, 2025: 1325–1340. doi:10.1145/3715275.3732089

  32. Vishwakarma R, Kumar S, Jamidar R. What gets cited: Competitive GEO in AI answer engines. Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2026. arXiv:2605.25517

  33. Vykopal I, Pikuliak M, Ostermann S, Šimko M. Assessing web search credibility and response groundedness in chat assistants. Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics, 2026: 2539–2560. doi:10.18653/v1/2026.eacl-long.115

  34. Wan A, Wallace E, Klein D. What evidence do language models find convincing? Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics, 2024: 7468–7484. doi:10.18653/v1/2024.acl-long.403

  35. Watanabe K, Nakayashiki K. Disentangling answer engine optimization from platform growth: A log-based natural experiment on ChatGPT referral traffic, 2026. arXiv:2606.04362

  36. Wen Y, Zhang N, Yuan H, Chen X, Zhang H, Guo H. Position: Generative engine optimization creates underexamined risks, governance must target concentration, disclosure, and academic blind spots. Proceedings of the 43rd International Conference on Machine Learning: Position Paper Track, 2026. arXiv:2606.12439

  37. Wu B, Mao F, Lin J, Yang C, Lu J, Guo Y, Zhang S, Wu Y, Huang Y, Li F. From experience to skill: Multi-agent generative engine optimization via reusable strategy learning. Findings of the Association for Computational Linguistics: ACL 2026, 2026a: 43305–43315. doi:10.18653/v1/2026.findings-acl.2149

  38. Wu Y, Tang J, Liu J, Xu H, Yao F. Do AI overviews benefit search engines? An ecosystem perspective, 2026b. arXiv:2601.22493

  39. Wu Y, Zhong S, Kim Y, Xiong C. What generative search engines like and how to optimize web content cooperatively. The Fourteenth International Conference on Learning Representations, 2026c. ICLR 2026

  40. Xie K, Laban P, Choubey PK, Xiong C, Wu CS. Do RAG systems cover what matters? Evaluating and optimizing responses with sub-question coverage. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics, 2025: 5836–5849. doi:10.18653/v1/2025.naacl-long.301

  41. Xing T, Li J, Du Y, Hu X. Are LLMs reliable rankers? Rank manipulation via two-stage token optimization. Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, 2026: 9120–9132. doi:10.18653/v1/2026.acl-long.413

  42. Xu H, Iqbal U, Montgomery JM. Measuring Google AI overviews: Activation, source quality, claim fidelity, and publisher impact, 2026. arXiv:2605.14021

  43. Yu J, Yang M, Ding Y, Sato H. Structural feature engineering for generative engine optimization: How content structure shapes citation behavior, 2026. arXiv:2603.29979

  44. Yuan J, Wang J, Wang Z, Sun Q, Wang R, Li J. AgenticGEO: A self-evolving agentic system for generative engine optimization, 2026. arXiv:2603.20213

  45. Zhang F, Cheng Q, Wan J, Singh V, Rao J, Boakye K. Generative engine optimization: A VLM and agent framework for Pinterest acquisition growth, 2026a. arXiv:2602.02961

  46. Zhang K, He X, Yao J. From citation selection to citation absorption: A measurement framework for generative engine optimization across AI search platforms, 2026b. arXiv:2604.25707

  47. Zheng J, Gema AP, Hong G, He X, Minervini P, Sun Y, Xu Q. GRADA: Graph-based reranking against adversarial documents attack. Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, 2025: 22244–22266. doi:10.18653/v1/2025.emnlp-main.1132

  48. Zhou H, Chen J, Chen X, Bao J, Chen Z, Liao Y. IF-GEO: Conflict-aware instruction fusion for multi-query generative engine optimization. Findings of the Association for Computational Linguistics: ACL 2026, 2026: 27576–27590. doi:10.18653/v1/2026.findings-acl.1373