AI 搜索可见性究竟有多可复现?
作者: Stanislav Kirichenko …生成式引擎优化(GEO)中的提示词-同义改写敏感度与置信度感知测量协议
Stanislav Kirichenko
独立研究员,sk-seo.ru
staurus86@gmail.com
预印本。2026年7月22日
摘要
生成式引擎优化(Generative Engine Optimization, GEO)如今已被作为一项可度量的服务进行商业化销售,然而其标准测量方法却是一个单一的点估计:将一组固定的提示词篮子(prompt basket)输入模型,统计品牌提及次数,然后报告一个百分比。我们通过针对俄语查询的三项对照实验,探讨这一数字是否具备可复现性。(A) 在四个不同日期跨度下,被引用域名的平均两两杰卡德重叠度(pairwise Jaccard overlap)仅为 0.356(33 个查询,使用的模型为 openai:gpt-4o-mini-search-preview)。(B) 在十分钟内的五次连续运行中,该重叠度为 0.722(8 个查询,使用的模型为 perplexity:sonar);在 95 个“查询-域名”对中,只有 49 个(51.6%)在全部五次运行中均被保留。(C) 我们的核心结果隔离出了一个常被市场忽视的方差来源:提示词措辞(prompt phrasing)。在包含 8 个意图 × 5 种同义改写 × 5 次重复的设计(共 200 个回答)中,我们定义了提示词-同义改写指数(Prompt-Paraphrase Index, \(PPI = W - B\)),其中 \(W\) 为同义改写内部的可复现性,\(B\) 为不同同义改写之间的相似度。我们测得 \(W = 0.723\),\(B = 0.431\),\(PPI = 0.292\)(聚类自助法 95% 置信区间为 [0.206, 0.372];置换检验经 Holm 校正后的最大 \(p = 0.0008\))。在 300 个“意图-域名”对中,有 173 个(58%)在不同同义改写间的出现率极差(presence range)至少达到 50 个百分点;对于 35% 的配对而言,某些措辞在全部五次运行中都引用了该域名,而另一次措辞在所有五次运行中都未引用。编写提示词篮子的供应商控制着这一方差,因此未经审计的 GEO 百分比并不是网站本身的一种稳定属性。为此,我们提出了 GEO 信号通行证(GEO-Signal Passport),用一套可操作的指标替代单一的百分比:置信度调整可见性(Jeffreys 下界)、提示词篮子分解、三轴稳定性报告、引用半衰期、引用/吸收/保真度拆分,以及用于归因的双重差分设计。所有公式均经过数值验证;代码和数据已开源以供复制。
关键词:生成式引擎优化、AI 搜索、大语言模型可复现性、测量、检索方差、引用稳定性、信息检索
1. 引言
我自己的网站上的测量工具曾有三周无法查看流量来源。页面浏览量表里有 1030 条记录;在全部 1030 条记录中,“引用来源(referrer)”字段包含的都是当前正在浏览的页面的地址。页脚加载了一个跟踪像素,服务器从该请求的 HTTP_REFERER 中读取来源——而这个变量代表的是像素所在的页面,而不是访客来自的页面。这一列一直在写入它自己的地址。当我坐下来统计 AI 助手给我发送了多少流量时,答案是零。但这里的零并不意味着“助手没有发送任何人”;而是意味着“我什么也没测量到”。从仪表盘上看,这两种状态是无法区分的。
这种无法区分性正是本文的主题,它从一个网站上升到整个行业。生成式引擎优化——即提升品牌在 ChatGPT、Perplexity、Gemini 以及谷歌 AI Overviews 输出中的存在感——现在已是一项付费服务,并有一个标准交付物:“AI 可见性”百分比。供应商选择一组提示词,通过一个或多个模型运行它们,统计客户的品牌或域名的出现频率,并报告其份额。这个数字月复一月地被当作关键绩效指标(KPI)呈报。
我们退后一步,追问这个数字是否具有足够的复现性,能否真正成为一个 KPI。决定这一点的有三个属性,而市场却将它们混为一谈:
- 运行到运行的复现性(Run-to-run reproducibility):相同的提示词重复运行,是否会返回相同的来源?
- 同义改写稳健性(Paraphrase robustness):表达相同信息的等效重新表述,是否需要返回相同的来源?
- 时间漂移(Temporal drift):数字是否会因为与任何优化工作无关的原因而日复一日地发生变化?
我们在第 4 节中对这三者进行了测量。据我们所知,同义改写之间的测量结果首次量化了报告的 GEO 百分比中有多少是由措辞选择而非网站本身产生的——而且这一比例相当巨大。随后,我们在第 5 节中将这一批判转化为一个建设性的协议:一小套指标,每个指标都有明确的分母和已知的测不准性,从业者可以立即开始收集。
我们的贡献包括:
- 一个四层概念框架,将可见性、引流(referral)、影响力(influence)和结果(outcome)分离开来,每一层都有其自身的测量工具和失效模式(第 3 节),该框架与 Martinez [1] 的流水线相契合但又有所区别。
- 针对非英语语言的三项受控复现实验,包括同义改写敏感度设计和提示词-同义改写指数(第 4 节)。
- GEO 信号通行证:置信度调整可见性、提示词篮子分解、三轴稳定性报告、引用半衰期、引用/吸收/保真度分离以及双重差分估计器(第 5 节),所有公式均经过数值验证。
- 用于复制的开放数据和代码。
2. 相关工作
GEO 及其测量
Aggarwal 等人 [2] 在 KDD 2024 上引入了 GEO,表明内容端优化可以将来源在生成式回答中的可见性提升高达 40%,且不同领域的有效策略各不相同。Martinez [1] 综述了 45 项研究(2023 年 11 月至 2026 年 7 月),将 GEO 框架化为一个部分可观测的随机流水线,包含八个阶段:搜索激活、抓取与索引、检索、重排与上下文分配、引用、显著性、事实吸收、保真度以及用户行为。他引入了一个“将可发现性、引用、吸收和经济结果相分离的可见性向量”,并推荐了一个可复现的协议:重复测量、同义改写、对照、人工验证以及考虑竞争参与者之间的干扰。他的核心否定性结论促成了我们的动机:没有哪种审查过的主体技术能够对有机可发现性或下游行为产生稳定、纵向、跨平台的因果效应。我们的工作为该综述所呼吁的实证复现证据提供了部分支持,并将“可见性向量”转化为可计算的公式。
生成系统的不确定性与可复现性
Atil 等人 [3] 表明,在名义上确定性的设置下,五个模型在十次运行中的准确率差异高达 15%,最优与最差之间的差距高达 70%——这正是检索增强回答中运行间不稳定性背后的机制。与我们的实证工作最为接近的是 Sielinski [4],他在三个消费品主题上,连续九天(每隔 10 分钟)对 Perplexity Search、OpenAI SearchGPT 和 Gemini 的可见性进行了测量,并得出结论:“单次运行的可见性指标提供了一幅具有误导性精确度的图景。”Schulte 等人 [5] 跨越 4 个引擎跟踪了 4 个垂直领域 45-46 天,报告跨天的源杰卡德重叠度为 0.34-0.42,RBO 为 0.21-0.26(对于 24 小时内的重复运行,杰卡德重叠度为 0.32-0.43,RBO 为 0.15-0.27)。我们的实验 B 在不同的语言、主题集和指标上独立复现了单次运行不稳定的发现;我们的实验 C 则增加了一个上述研究所未能隔离的方差轴——同义改写。我们同时指出了这些数字所带来的指标注意事项(第 4.5 节):上述 RBO 值为最小边界、非外推形式 \(p=0.9\),因此其上限取决于列表长度,无法与杰卡德重叠度进行数值上的直接比较。
点击损失与因果设计
关于下游流量的最强因果证据来自一项预注册的现场实验:Agarwal 和 Sen [6](AEA RCT 注册中心 AEARCTR-0017393;1065 名美国参与者;对照组 \(N=396\),隐藏式 AIO 组 \(N=374\),AI 模式组 \(N=295\))发现,在触发了 AI Overview 的查询中,外部有机点击量从每次搜索的 0.62 下降到 0.37(下降 39.8%),零点击率从 0.54 上升到 0.73(上升 34.5%),对非 AIO 查询进行的安慰剂检验显示各组之间没有差异。至关重要的是——这一点经常被错误引用——这些数字是以 AIO 触发为条件的:由于 AIO 在大约 41% 的搜索中触发,整体平均值大约为 18.5% 的点击率和 +20.4% 的零点击率(条件数字与整体数字是一致的,并不矛盾,因为查询权重是由对点击的贡献决定的,而不是由搜索份额决定的)。Khosravi 和 Yoganarasimhan [7] 的第二项准实验利用了 AIO 在各语言中交错推出的特点,对 161,382 个维基百科“文章-语言”对进行了双重差分分析,发现英文文章的流量下降了约 15%——这是一种达到相同数量级的不同方法。Xu 等人 [8] 审核了 55,393 个查询和 98,020 个原子声明,报告称约 30% 被引用的域名位于有机搜索 Top 之外,且 AI-Overview 声明中有 11.0% 不受其所引用的来源支持。
无点击频道的测量
一个不留下引用来源却能影响行为的渠道,这一问题并不新鲜。Binet 的搜索份额(Share of Search)[9] 在 30 个案例、12 个类别和 7 个国家中,将品牌的品牌搜索份额与市场份额的相关性达到了 0.83,并且领先销售额数月到一年。充满噪声的渠道的计量经济学是残酷的:Lewis 和 Rao [10] 在 25 项现场实验中表明,广告投资回报率(ROI)的中位数置信区间超过了 100 个百分点。贝叶斯结构时间序列 [11] 是 CausalImpact 工具的基础。我们将在第 6 节中重新探讨为什么这些工具只能部分迁移到 AI 渠道。
3. “AI 流量”的四层框架
关于“AI 走了多少流量”的大多数分歧并非关于事实的争论,而是一个分类错误:发言者测量的是不同的对象,却给它们起了相同的名字。我们将四个层级区分开来,每一层都有独特的测量工具和主要的失效模式。
表 1:用于“AI 流量”的四层框架:每一层都有独特的测量工具和主要的失效模式。
| 层级 (Level) | 测量的对象 (What is measured) | 测量工具 (Instrument) | 主要失效问题 (Dominant problem) |
|---|---|---|---|
| 可见性 (Visibility) | 答案中的品牌存在感 | 提示词跟踪 | 不稳定性与篮子选择 |
| 引流 (Referral) | 来自 AI 的访问流量 | GA4、分析工具、日志 | 丢失引用来源(Referrer) |
| 影响力 (Influence) | AI 塑造了选择;访问通过其他途径到达 | 调研、品牌搜索 | 渠道混合 |
| 结果 (Outcome) | 销售线索与收入 | CRM、实验 | 因果关系 |
这五个问题对应着五个不同的分母:杰卡德重叠度测量引用域名集的稳定性;分析工具捕获了一小部分引流;调研捕获了陈述的认知来源;CRM 记录一笔交易;随机实验记录点击量的因果变化。该框架与 Martinez 的八阶段流水线 [1] 兼容但不完全相同:我们为从业者将引流与影响力分离开来,而他在模型内部将引用与吸收分离开来。我们在全文中贯彻的规则是:将每个数字精确分配到一个层级,绝不把来自不同层级的数据串联进同一条证据链中。
引流层很好地说明了这个陷阱。在公开的单站点测量中,13 个 AI 服务域名在 90 天内产生了 634 次访问中的 10 次访问;直接访问(direct visits)为 552 次(87.1%)。人们很容易将这 552 次重新分类为隐藏的 AI 流量。这是错误的:直接访问包括书签、输入的网址、即时通讯工具、应用程序、被剥离参数的链接、隐私浏览器以及邮件客户端。可辩护的主张是狭义的——某些 AI 访问在物理上与其他直接流量无法区分,因此引流数字是一个正确的下界,而不是一个损坏的仪器。
4. 实证研究:AI 搜索可见性的可复现性
4.1 设置与数据
所有的测量都是通过固定的流水线对生产引擎进行查询,并记录每个回答所引用的域名集。使用了两个引擎,且绝不将它们作为单一系统进行比较:openai:gpt-4o-mini-search-preview(实验 A)和 perplexity:sonar(实验 B 和 C)。区域设置、个性化、会话状态、缓存以及提供商端的路由既未固定也未记录;因此,每个实验测量的是整个部署电路(API、源检索、重排和生成)的可复现性,而不是单个模型的孤立非确定性。对于实际的追踪器而言,这是一个正确的量:用户接收到的是作为整体的电路输出。所有原始数据和分析脚本均已开源(第 8 节)。
4.2 实验 A —— 跨天漂移
引擎:openai:gpt-4o-mini-search-preview;四个日期(2026 年 7 月 5 日、7 日、12 日、19 日);716 次引用;273 个域名。在至少两个日期收到引用的 33 个查询(共 35 个)中,跨日期引用域名集的平均两两杰卡德重叠度为 0.356。在 33 个查询中,第一位置(first-position)的域名保持不变的仅有 4 个。在极端情况下(“如何撰写 AI Overviews 和 ChatGPT 会引用的文章?”),三个日期的杰卡德重叠度为 0.00——三个完全不相交的来源集。
4.3 实验 B —— 会话内噪声
引擎:perplexity:sonar;在约十分钟内进行五次连续运行;8 个俄语查询;400 次引用。在十分钟内外部语料库发生实质性变化的概率微乎其微,因此观察到的方差主要反映了检索和生成的 không ổn định(不稳定性);我们并不声称输出不可能发生变化(路由、检索到的文档集、排名和缓存状态都可能发生偏移)。
- 集合重叠度:重复运行之间的平均两两杰卡德重叠度为 0.722(单查询范围 0.56-0.84)。
- 头部稳定性:在 8 个查询中有 3 个查询的第一位置域名发生了变化。一个医疗查询在运行间交替变化:
sostav.ru\(\leftrightarrow\)medesk.ru\(\leftrightarrow\)sostav.ru\(\leftrightarrow\)medesk.ru\(\leftrightarrow\)sostav.ru。 - 出现频率:在 95 个“查询-域名”对中,有 49 个(51.6%)出现在全部五次运行中;14 个仅出现在一次运行中,14 个出现在两次运行中(两者合计 29.5%);其余 18 个出现在三次或四次运行中。出现在五分之四运行中的配对并非噪声,因此“一半的来源是涟漪”夸大了数据;准确的说法是,单次运行无法复现来源的全貌。
4.4 实验 C —— 提示词-同义改写敏感度(核心结果)
市场通过选定的提示词来测量回答。在这里,我们测量措辞的选择本身在多大程度上产生了所报告的结果。
设计:8 个信息需求(意图) × 5 种同义改写 × 5 次重复 = 200 个回答,引擎:perplexity:sonar。40 种措辞分五个随机块执行——每个块以随机顺序运行所有 40 种措辞,因此时间漂移不会伪装成措辞效应。同义改写保持了实体、语言、区域、意图类型和约束条件不变;它们改变了词汇、句法和语体(五种类型:原始、词汇、句法、对话、短搜索)。数据包含 226 个唯一域名,没有空回答,且所有 40 个单元格中恰好有 5 次重复。
估计器:原始的同义改写间相似度是不够的,因为它还包含了普通的引擎噪声。对于意图 \(i\),设 \(C_{ivr}\) 为针对同义改写 \(v\)、重复 \(r\) 所引用的域名集。定义:
$$W_{i} = \\text{mean}_{v} \\text{mean}_{r < s} J(C_{ivr}, C_{ivs})$$$$B_{i} = \\text{mean}_{v < u} \\text{mean}_{r, s} J(C_{ivr}, C_{ius})$$
$$PPI_{i} = W_i - B_i$$
$$SPR_{i} = B_i / W_i$$
其中 \(J\) 为杰卡德系数,\(W_i\) 为同义改写内部的可复现性(基线电路噪声),\(B_i\) 为同义改写之间的相似度,\(PPI\) 为同义改写惩罚(paraphrase penalty),\(SPR\) 为保留的基线稳定性份额。用 \(W\) 减去 \(B\) 即可剥离出单纯由措辞带来的贡献。
结果:对 8 个意图进行聚类自助法(实验单位是信息需求,而不是单个回答),得到的 \(PPI\) 95% 置信区间为 [0.206, 0.372];排除了零。通过在每个意图内打乱同义改写标签进行置换检验(10,000 次置换);在跨 8 个比较进行 Holm 校正后,最大调整后的 \(p\) 值为 0.0008——全部八个意图仍然显著。在去除了普通电路噪声后,同义改写平均保留了 60% 的基线稳定性;来源集的额外破坏并非抽样人工产物,而是在所有八个意图中都得以复现。
图 1 绘制了每个意图的 \(W\) 和 \(B\)。意图之间的离散程度比平均值更重要。对于“哪些服务检查 AI 搜索中的品牌可见性”,\(PPI = 0.086\)——措辞几乎不重要。对于“如何撰写 AI Overviews 引用的文章”,\(PPI = 0.433\)——措辞比查询的主题本身更能决定结果。
出现率极差(Presence range) —— 可以向客户展示的图表。取出现过至少一次的每个域名,计算其在同义改写中的出现率极差(分母:300 个“意图-域名”对;图 2),其中 173 个(58%)的极差至少为 50 个百分点;对于 35% 的配对而言,某个措辞在全部五次运行中都引用了该域名,而另一个措辞在所有五次运行中都未引用。三分之一被引用的来源在“始终出现”和“从不出现”之间切换,纯粹取决于问题的提问方式,而网站本身没有任何变化。
这对市场的直接后果是:编写提示词篮子的供应商实质上控制了最终的百分比,甚至不需要故意操纵。因此,可复现性需要的不仅仅是一个冻结的列表——它需要完整的提示词文本、模型和模式、重复次数、日期、区域、聚合规则以及空回答处理方式。
表 2:每个意图的同义改写内部可复现性 \(W\)、同义改写间相似度 \(B\)、同义改写惩罚 \(PPI = W - B\) 以及保留的稳定性份额 \(SPR = B / W\)(perplexity:sonar,200 个回答)。
| 意图 (Intent) | W | B | PPI | SPR |
|---|---|---|---|---|
| citable_articles (可引用文章) | 0.662 | 0.230 | 0.433 | 0.35 |
| rank_trackers (排名跟踪器) | 0.681 | 0.282 | 0.400 | 0.41 |
| hire_seo (聘请 SEO) | 0.813 | 0.442 | 0.371 | 0.54 |
| mention_tracking (提及跟踪) | 0.596 | 0.235 | 0.361 | 0.39 |
| geo_definition (GEO 定义) | 0.665 | 0.318 | 0.347 | 0.48 |
| medical_seo (医疗 SEO) | 0.709 | 0.514 | 0.196 | 0.72 |
| traffic_drop (流量下降) | 0.896 | 0.757 | 0.139 | 0.84 |
| visibility_tools (可见性工具) | 0.758 | 0.672 | 0.086 | 0.89 |
| 平均值 (Mean) | 0.723 | 0.431 | 0.292 | - |
(注:图 1 及图 2 的可视化文本说明已在上方段落中详细论述)
4.5 稳定性是三个轴,而不是一个
这三个实验测量的是不同的坐标,决不能被折叠成一个单一的“稳定性 \(= X\%\)”:
$$\\text{Stability} = [S_{\\text{run}}, S_{\\text{prompt}}, S_{\\text{time}}]$$其中 \(S_{\\text{run}} = 0.72\)(实验 B),由 \(PPI = 0.29\) 表征的提示词轴(实验 C),以及 \(S_{\\text{time}} = 0.36\)(实验 A,一个不同的引擎)。两个一致性说明:在实验 C 内部,八个原始措辞复现出了 \(W = 0.723\),与实验 B 的 0.722 在小数点后第三位吻合,尽管样本有重叠,但这属于一致性检查,而非独立复制;由于引擎不同,A 不能与 \(B/C\) 进行数值上的直接比较。
排序列表的一致性:对于排序列表而非集合,排序偏置重叠(Rank-Biased Overlap, RBO)是合适的,但其最小边界、非外推形式 \((p=0.9)\) 具有一个取决于列表长度\(k\) 的上限 \(1 - p^k\):当 \(k=5\) 时为 0.410,当 \(k=3\) 时为 0.271,当 \(k=10\) 时为 0.651。在五个项目的列表上 RBO 为 0.26 达到了其可达最大值的 63%,并不是崩塌;RBO 和杰卡德处于不同的标度上,其值不能直接比较。因此,为了内部使用,我们将其归一化为 \(nRBO = RBO_{\\min} / (1 - p^k)\),但仍然将集合重叠度(杰卡德)和排名重叠度(\(nRBO\))报告为两个独立的坐标,绝不将其融合成一个混合数字。
5. GEO 信号通行证:一种可操作的协议
前面的批判是破坏性的;本节则是替代方案。将 GEO 划分层级的框架并非由我们原创——它是该领域的前沿,归功于 Martinez [1]。这里的新意在于一套操作公式,能够将该框架转化为从业者下周就能产出的报告。以下所有公式均经过数值验证。
符号说明:\(q\) 为提示词或信息需求;\(e\) 为平台;\(r\) 为重复次数;\(t\) 为日期;若品牌被提及或域名被引用,则 \(y_{qert} = 1\);\(w_q\) 为提示词权重;\(\\pi_e\) 为平台权重;\(k\) 为引用位置。
5.1 置信度调整可见性 (Confidence-Adjusted Visibility, CAV)
标准跟踪器将品牌回答除以所有回答,并将 5 分之 5 显示为 100%。与点估计不同,我们报告的是一个 Jeffreys 先验后验下界:
$$p_{qe} \\sim \\text{Beta}(m + 0.5, n - m + 0.5)$$$$LCB_{qe} = Q_{0.05}(p_{qe})$$
$$CAV = \\sum_{q} \\sum_{e} w_q \\pi_e LCB_{qe}$$
该表并未规定通用的运行次数;它为“品牌始终出现”这一主张标定了代价。在五次运行中取得五次成功,在单侧 95% 置信度下,仅支持大约 69% 的存在概率。这使 Sielinski 关于“报告不确定性而不是将单次运行当成现实”的建议得以落地操作 [4]。
图2:每个引用领域的意图五种同义表述中的存在范围(300个意图- (领域配对)。在35%的配对中(最右侧的条形图),一种表述方式在五次运行中均引用了该领域 另一个无处不在——一个由文字驱动的全开/全关开关。
表 3:置信度调整可见性:在 \(n\) 次运行中取得 \(m\) 次成功的点估计 vs. 单侧 95% 下界(Jeffreys 先验)。
| 结果 (Result) | 点估计 (Point estimate) | 95% 下界 (Lower 95% bound) |
|---|---|---|
| 5 / 5 | 100% | 69.4% |
| 4 / 5 | 80% | 43.7% |
| 3 / 5 | 60% | 26.1% |
| 10 / 10 | 100% | 82.9% |
| 9 / 10 | 90% | 66.9% |
| 20 / 20 | 100% | 91.0% |
| 19 / 20 | 95% | 82.0% |
5.2 提示词篮子分解 (Prompt-Basket Decomposition)
这把真正的优化与测量工具的改变(任何提示词篮子随时间增长的报告的失效模式)分离开来。设 \(p_{i,t}\) 为时期 \(t\) 下提示词组 \(i\) 内的可见性,\(w_{i,t}\) 为其篮子份额,则:
$$V_t = \\sum_{i} w_{i,t} p_{i,t}$$$$\\Delta V = \\sum_{i} ar{w}_i (p_{i,1} - p_{i,0}) + \\sum_{i} ar{p}_i (w_{i,1} - w_{i,0})$$
$$\\text{[性能效应]} \\qquad\\qquad\\qquad\\qquad\\qquad\\qquad \\text{[篮子效应]}$$
其中 \( ar{w}_i = (w_{i,0} + w_{i,1}) / 2\),\( ar{p}_i = (p_{i,0} + p_{i,1}) / 2\)。该分解是精确的——这两个分量相加完全等于 \(\\Delta V\)(经机器精度验证,残差约为 \(10^{-17}\))。它强制执行的规则是:在将性能效应和篮子效应分开展示之前,供应商不得报告“可见性从 20% 上升到 43%”(图 3)。
(注:图 3 的可视化文本说明已在上方段落中详细论述)
5.3 引用半衰期 (Citation Half-Life)
市场展示了“12 次提及变成了 20 次”,却没有回答它们是否得以保持。设 \(T_{qed}\) 为从初次出现到稳定消失的时间,\(S( au) = P(T > au)\) 为生存曲线,\(T_{50} = \\min\{ au : S( au) \\le 0.5\}\) 为半衰期;一个配对在连续两到三次缺席后被算作死亡(因此单次漏掉不会杀死一个活着的配对),而再次出现率将稳定存在与闪烁(flicker)区分开来。报告写明“可见性从 18% 上升到 27%,但新引用的中位寿命是六天”比任何提及图表都更诚实。外部支持:在 857K 份报告中,73% 的引用只出现一次就消失了 [12]。
5.4 引用 vs. 吸收 vs. 保真度 (Citation vs. Absorption vs. Fidelity)
Martinez [1] 将引用选择与事实吸收分离开来:一个来源可以坐在参考列表中,却几乎没有塑造回答。将回答切分为带有重要性 \(s_j\) 的原子声明 \(j\),若声明 \(j\) 实质性依赖于域名 \(d\) 则标记 \(u_{jd} = 1\),若其得到正确支持则标记 \(f_{jd} = 1\):
$$ACS_d = \\frac{\\sum_{j} s_j u_{jd}}{\\sum_{j} s_j}$$$$\\text{Fidelity}_d = \\frac{\\sum_{j} s_j u_{jd} f_{jd}}{\\sum_{j} s_j u_{jd}}$$
$$\\text{UsefulInfluenced}_d = ACS_d \\times \\text{Fidelity}_d$$
表 4:引用、吸收和保真度是独立的轴;一个来源可以占据任何组合。
| 引用 (Citation) | 吸收 (Absorption) | 保真度 (Fidelity) | 解释 (Interpretation) |
|---|---|---|---|
| 是 (yes) | 低 (low) | 高 (high) | 装饰性链接 (decorative link) |
| 是 (yes) | 高 (high) | 低 (low) | 被使用但被扭曲 (used but distorted) |
| 否 (no) | 高 (high) | 高 (high) | 隐藏吸收 (hidden absorption) |
| 是 (yes) | 高 (high) | 高 (high) | 完整的 GEO 存在感 (full GEO presence) |
初始标记可以使用大语言模型裁判(LLM judge),但部分样本必须通过人工验证,正如 Martinez 所建议的那样。相邻证据:AI-Overview 的声明中有 11.0% 不受其来源支持 [8];62% 的引用未提及品牌名称 [13]。
5.5 用于归因 GEO 工作的双重差分法 (Difference-in-Differences)
$$\\text{GEO Lift} = (V_{\\text{treat, post}} - V_{\\text{treat, pre}}) - (V_{\\text{ctrl, post}} - V_{\\text{ctrl, pre}})$$可比的页面或主题集群,一些被处理(treated),一些作为对照(controls),前后使用相同的提示词篮子,并通过对照消除了引擎的共同漂移。分别计算 \(Lift_{\\text{citation}}\)、\(Lift_{\\text{absorption}}\)、\(Lift_{\\text{fidelity}}\) 和 \(Lift_{\\text{referral}}\)——即第 3 节中不同的独立层级,绝不将其融合成一个混合效应。遵循 [1] 的建议,预注册测量的效应、分母和最小有意义差异;使用 3-5 种同义改写和紧密的重复;在进行试点方差估计后确定最终样本量。如果页面可以随机分配,则随机化优于准实验。
5.6 辅助指标
-
检测完整性(Detection completeness,来自生态学的 Chao1),采用在 \(f_2 = 0\) 时依然成立的偏差修正形式:
$$\\hat{S} = S_{\\text{obs}} + \\frac{f_1(f_1 - 1)}{2(f_2 + 1)}$$
$$\\text{Coverage} = S_{\\text{obs}} / \\hat{S}$$其中 \(f_1\) 和 \(f_2\) 是恰好被看到一次和两次的域名。这是一个饱和度诊断工具,而不是对现有来源的真实计数(该模型假设一个平稳的抽样来源,而 AI 输出会漂移),因此应在短窗口内应用。
-
跨引擎稳健性(Cross-engine robustness),暴露出平均值隐藏的风险:
$$s_e = p_e / \\sum_{e} p_e, \\quad \\text{HHI} = \\sum_{e} s_e^2$$
$$\\text{CER} = \\frac{1 - \\text{HHI}}{1 - 1/E}$$其中 \(E\) 为引擎数量;在均匀可见性下 \(\\text{CER} = 1\),当一个引擎提供所有内容时 \(\\text{CER} = 0\)。“可见性 30%,CER 0.18”意味着一个引擎承担了几乎全部可见性。
-
业务加权可见性(Business-weighted visibility):\(w_i = (D_i T_i L_i) / \\sum_{j} (D_j T_j L_j)\),其中 \(D\) 为需求代理变量,\(T\) 为 AI 回答激活频率,\(L\) 为期望线索价值;\(BWV = \\sum_{i} w_i CAV_i\)。这是一个优先级指数,而不是真实 AI 受众体量的估计——封闭助手内部的用户提示词频率对任何人来说都是未知的。
6. 讨论
可以承诺什么与不能承诺什么
没有公开描述的、经过验证的方法能够为单个网站预测 AI 流量;两项独立检索均未返回此类方法,这仅在其否定形式上支持该主张。自然的迁移候选者——一个具有已证明预测准确性的“搜索份额风格”的领先指标 [9]——在今天由于四个可检验的原因而失效:(1)历史在物理上是不够的:诸如 Meridian 之类的媒体组合模型需要两到三年每周的数据,而处于稳定体量的 AI 流量还更年轻。(2)信号淹没在噪声中:对于大多数网站而言,0.1-3% 的 AI 份额是直接流量的每周波动带,低于 MMM 或 CausalImpact 的分辨率。(3)Geo 升降在设计层面上失效:ChatGPT 内部的可见性无法按区域关闭。(4)不存在模拟指标——一个具有已证明预测有效性的“AI 回答中的品牌提及份额”是一个空白领域,而不是一个未使用的工具。障碍(1)和(2)随着时间会缓和;(3)需要不同的实验;(4)正是本协议旨在建构的空缺研究利基。
准确理解的话,Martinez 的结论 [1] 并非虚无主义:没有哪种审查过的主体技术表现出同时稳定、纵向且跨平台的因果效应。局部效应依然存在;失效的是将它们作为普遍规律跨平台、跨主题和跨时期进行推广。因此,诚实的承诺是:具有标明不确定性的可测量可见性、分解后的动态、作为下界的观察到引流,以及作为影响力指标的调研信号。不诚实的承诺则是:没有提示词篮子的可见性百分比、流量预测、渠道 ROI,以及任何未拆分为工作和工具改变的增长数字。
7. 局限性
本实证研究使用了一种非英语语言、两个引擎以及每个实验一种配置;区域设置、个性化、会话状态、缓存和提供商路由既未设定也未记录,因此测量限制了所部署电路的可复现性,而不是任何具名模型的非确定性。在没有进一步测量的情况下,这些比例不能迁移到其他主题、语言、模型或提供商。跨天漂移(A)和会话内噪声(B)是在不同引擎上测量的,不能作为同一系统的估计值进行比较。未计算目标品牌提及率:引用模块返回的链接不包含回答文本,因此该字段留空,而不是用模仿来填充。三个稳定性轴是在部分不同的电路上测量的,不能简化为单一指标。第 3 节中的网站计数器轶事是一个构建缺陷,被刻意保留未修复,作为一项独立的部署任务;在修复之前,无法对该网站的流量结构得出任何结论。
8. 结论
在经典搜索中,排名是可以被观测到的。而在生成式搜索中,它必须被估计:一个隐藏的存在概率、其稳定性、来源被吸收到回答中的情况以及业务效应。我们表明,行业单一的可见性百分比未能通过基本的可复现性测试——它在运行间(十分钟内杰卡德重叠度 0.72)、天数间(0.36)以及——最明显也最被忽视的——等效问题的措辞间(\(PPI = 0.29\);三分之一的被引用来源仅凭措辞就完全开闭切换)发生变化,并且报告该数字的一方控制着这最后一个方差来源。因此,新搜索的测量单位不是排名或提及百分比,而是具有已知不确定性的指标向量。GEO 信号通行证就是该向量的一个具体实例,与其数据和代码一同开源,以便其他人能够对数字本身的数字提出质疑。
我们结束时的建议与开始时相同:打开你自己的计数器,检查源字段中放的是什么。连续三 weeks,我的计数器里装的都是同一个页面的地址。
利益冲突
作者经营一家独立的 SEO 和 GEO 咨询公司(sk-seo.ru),并在搜索可见性测量方面拥有商业利益。本文批判了商业 GEO 测量实践,包括作者可以销售的服务。为了保持论点可核查而非自吹自擂,报告的每一个数字都是从开源数据和代码中计算出来的,且批判的对象是方法,而非具名的竞争对手。
数据与代码可用性
要求供应商开放提示词篮子而自己却隐藏提示词篮子是不合逻辑的。数据和分析代码作为附属文件(anc/ 目录)随本提交内容一同附上:实验 C 的 200 个同义改写回答(paraphrase_scan.jsonl)、实验 B 的会话内序列(repeat_scan.jsonl)、实验 A 计算出的跨天序列、按类型标记的 40 种措辞,以及计算杰卡德重叠度、置换检验和聚类自助法的脚本(包含 URL/域名规范化和空回答处理规则)。
参考文献
[1] O. Martinez. Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023-2026). arXiv:2607.14035, 2026.
[2] P. Nagarajan, P. Aggarwal, V. Murahari, 等. GEO: Generative Engine Optimization. In Proc. 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD), 2024. DOI: 10.1145/3637528.3671900. arXiv:2311.09735.
[3] B. Atil, S. Aykent, A. Chittams, 等. Non-Determinism of “Deterministic” LLM Settings. arXiv:2408.04667, 2024.
[4] R. Sielinski. Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement. arXiv:2603.08924, 2026.
[5] J. Schulte, M. Bleeker, and P. Kaufmann. Don’t Measure Once: Measuring Visibility in AI Search (GEO). arXiv:2604.07585, 2026.
[6] S. Agarwal and A. Sen. The Impact of Google AI Overviews on Publisher Traffic and User Experience: Evidence from a Field Experiment. SSRN Working Paper 6513059, 2026. 预注册:AEA RCT Registry AEARCTR-0017393.
[7] M. Khosravi and H. Yoganarasimhan. Impact of AI Search Summaries on Website Traffic: Evidence from Google AI Overviews and Wikipedia. arXiv:2602.18455, 2026.
[8] H. Xu, U. Iqbal, and J. M. Montgomery. Measuring Google AI Overviews: Activation, Source Quality, Claim Fidelity, and Publisher Impact. arXiv:2605.14021, 2026.
[9] L. Binet. Share of Search as a Predictive Measure. IPA EffWorks Global, 2020.
[10] R. A. Lewis and J. M. Rao. The Unfavorable Economics of Measuring the Returns to Advertising. Quarterly Journal of Economics, 130(4):1941-1973, 2015.
[11] K. H. Brodersen, F. Gallusser, J. Koehler, N. Remy, and S. L. Scott. Inferring Causal Impact Using Bayesian Structural Time-Series Models. Annals of Applied Statistics, 9(1), 2015. DOI: 10.1214/14-AOAS788.
[12] Trakkr. Citation persistence in AI answers (analysis of 857K reports). 行业报告(未同行评审). 待插入网址.
[13] Semrush and K. Indig. The Ghost Citations Study. 行业报告(未同行评审). 待插入网址.