生成式引擎优化的结构特征工程:内容结构如何塑造引用行为

作者: 于俊伟(第一作者)— 东京大学,日本东京 /杨沐风(第二作者)— 筑波大学,日本茨城 /丁业鹏(第三作者)— 广岛大学,日本广岛 /佐藤宏之(第四作者)— 东京大学 / 国立信息学研究所,日本东京

Structural Feature Engineering for Generative Engine Optimization: How Content Structure Shapes Citation Behavior

第一章 引言

大语言模型驱动的生成式引擎的普及,从根本上改变了信息发现的方式——从传统的基于链接的搜索结果转变为直接答案生成加选择性来源归属。与传统搜索引擎呈现排列好的文档列表不同,像 ChatGPT、Google 搜索生成体验(SGE)和 Perplexity.ai 这样的生成式引擎,在生成内容中嵌入引用的同时,从多个来源合成信息来生成连贯的回复。这一范式转变在内容可见性的经济模式中创造了紧迫的变革:传统的"点击"模型已经演变为"引用"经济,在 LLM 生成的回复中被引用变得比网站流量更有价值。

虽然现有 GEO 研究已经展示了通过内容修改策略可将引用率提升至高达 40%,但当前的方法主要集中在语义内容修改上——如添加统计数据、引用和权威性语言——而基本忽略了内容结构特征的系统性作用。这一显著的差距使内容创作者缺乏基于证据的、将结构组织作为优化目标的具体指导。此外,现有的 GEO 策略对不同的生成式引擎架构一视同仁,忽视了这样一个事实:底层检索-生成机制——包括 Search-then-Synthesize(先搜索后合成)、Iterative Refinement(迭代精炼)和 Integrated Search-Generation(集成搜索生成)——本质上以不同的方式处理结构信息。

为弥补这些不足,我们提出 GEO-SFE,一个用于量化并优化内容结构特征以提升 LLM 引用性能的框架。本研究将内容结构分解为三个互补的层级:(1)宏观结构——文档级架构,包括标题层级、导航元素和整体文档流程;(2)中观结构——段落级组织,涵盖段落组织、格式多样性和信息密度;(3)微观结构——句子级强调模式,包括视觉强调分布、关键词位置和句法结构。我们的方法论开发了架构相关的预测模型,捕捉了不同生成式引擎架构的结构偏好,并实现了在语义保留约束下的优化算法——确保优化后的内容在人类读者眼中保持连贯且有意义。

本工作的主要贡献有三方面:

  • 框架贡献: 我们提出 GEO-SFE,这是首个系统性地将内容结构分解为宏观、中观和微观三个层级的 GEO 框架,并在每层上提供量化指标和优化策略,将直觉式的内容优化转变为数据驱动的方法论。

  • 实证贡献: 通过覆盖 200 篇文章、6 个生成式引擎平台的综合实验(总计 2,400 个测试用例),我们展示了结构优化使引用表现持续提升 17.3%(p < 0.001,Cohen’s d = 0.64),经 G-Eval 主观评估确认感知质量平均提升 18.5%。消融分析证实了每个结构层级的独立贡献。

  • 实用贡献: 我们建立了内容结构优化的五项基本原则,并提供了可直接落地的指南和算法,使内容创作者无论是否具备技术背景,都能立即应用结构优化策略,覆盖多种生成式引擎架构。

本研究建立了 GEO 结构优化的首个工程化方法,将内容可见性策略从直觉驱动的实践转变为数据驱动的方法论,并可为在 LLM 驱动的信息生态系统中导航的日益庞大的内容创作者群体提供即时的实际应用价值。


第二章 相关工作

A. 生成式引擎架构

生成式引擎代表了一类独特的信息检索系统,将大语言模型与实时网络搜索能力相结合。与传统搜索引擎返回排好序的文档列表不同,这些系统从多个来源合成信息以生成具有内嵌引用的综合性回复。

现代生成式引擎采用多样化的检索和生成策略,每种策略对内容优化都有不同的含义。下表对主要的架构方法进行了分类:

架构类型 查询处理 检索与生成流水线 引用机制 GEO 优化重点
标准生成式引擎 查询分解为子查询 {q1…qn} 搜索引擎检索→文档摘要→多源合成 回复中的直接URL引用 语义清晰度、结构化数据
Web增强型RAG 直接查询到网络搜索 网络内容检索→上下文增强→回复生成 附录来源列表 时效性、E-E-A-T信号
RAG-Fusion LLM 生成查询变体 并行搜索→RRF分数融合→重排文档列表 多源归属 查询多样性覆盖
混合搜索 并行关键词+向量处理 双检索路径→RRF融合→统一排序 词法-语义联合来源 关键词-语义平衡
查询重写 SLM驱动的查询优化 重写查询→Web API调用→语义重排 相关性排序引用 查询意图对齐
多跳检索 递归查询分解 初始搜索→查询精炼→迭代检索 层级来源层 复杂推理路径
图-Web混合 实体识别+图遍历 知识图谱+网络搜索并行→交叉验证 KG/Web来源区分 事实一致性
实时Web 时间敏感查询检测 实时爬取→新鲜度评分→最新内容选择 时间戳引用 时效相关性
HyDE Web 假设性答案生成 答案作查询→相似性搜索→验证检索 权威匹配来源 答案-文档对齐
垂直领域 领域分类优先 目标权威站点搜索→术语规范化 领域特定(.edu/.gov)优先级 专业度展示

先前的相关工作可基于检索-生成交互的频率和时机,归纳为三种核心架构范式:

  • Search-then-Synthesize(先搜索后合成): 代表一次性、非交互范式
  • Iterative Refinement(迭代精炼): 引入多轮反馈循环以改善证据收集
  • Integrated Search-Generation(集成搜索生成): 允许在回复流式生成过程中进行动态、并发的检索

这三种截然不同的流程,从根本上需要不同的 GEO 策略。

B. 内容结构表示

我们将内容结构建模为三层层级分解:

宏观结构 M:文档级架构

M = {H, N, F}

其中 H 表示标题层级,N 表示导航元素,F 表示整体文档流程。

中观结构 E:段落级组织

E = {P, L, T}

其中 P 表示段落组织(词集),L 表示列表结构,T 表示表格格式。

微观结构 μ:句子级强调

μ = {Ed, Ep, Kp}

其中 Ed 表示强调分布,Ep 表示强调位置,Kp 表示关键词位置。

这一数学框架为我们系统性地进行生成式引擎优化的结构特征工程奠定了基础。


第三章 实验设计

A. 数据集与平台

实验数据集包含 200 篇覆盖健康、科技、金融、教育、旅游等多个垂直领域的文章。每篇文章均创建两个版本:原始基线版本和经 GEO-SFE 优化的版本。在六个主流生成式引擎平台上进行评估:ChatGPT(Search-then-Synthesize 架构代表)、Perplexity.ai(Iterative Refinement 架构代表)、Google AI Overviews、You.com、Microsoft Copilot 和 DeepSeek。

总计评估量: 200 篇文章 × 6 个平台 × 2 个版本 = 2,400 个测试用例。

B. 评估指标

客观指标: 评估框架包含主指标和辅助指标。主指标定义为:

  • 引用率(CR): 引用内容查询量 / 总查询量
  • 可见性得分(VS): 0.4 × 覆盖率 + 0.3 × 位置 + 0.3 × 影响力

辅助指标包括:(1)引用深度——每次引用平均提取的事实数量;(2)首位位置——回复中首次引用出现的平均位置。

主观评估: 除客观指标外,采用 G-Eval 方法,使用 Gemini 2.5 Pro 评估七个主观维度:相关性(Relevance)、影响力(Influence)、独特性(Uniqueness)、主观位置(Subjective Position)、主观数量(Subjective Count)、点击概率(Click Probability)和多样性(Diversity)。每个评估在温度 0.3 下取 5 个样本的中位数得分。


第四章 结构特征工程(GEO-SFE)

为应对优化生成式引擎中内容可见性的挑战,我们提出 GEO-SFE——一个系统性量化并优化内容结构特征以提升跨多种 LLM 驱动搜索架构引用性能的框架。我们的方法论将结构优化分解为三个层级——宏观结构(文档架构)、中观结构(信息分块与格式化)和微观结构(视觉强调模式),并开发了与三种核心生成式引擎范式对齐的架构特定优化策略。

GEO-SFE 框架将内容优化从直觉驱动的实践转变为数据驱动的工程原则。与传统 SEO 在语义内容和技术/链接因素之间取得平衡不同,也与现有 GEO 方法主要关注语义内容修改不同,我们的框架将结构组织视为一等优化目标。这使得内容呈现的系统性工程能够利用架构特定的注意力机制和引用偏好,同时保持大规模优化的计算可行性。

A. 层级结构特征分解

宏观结构特征

宏观结构涵盖文档级架构元素,确立整体信息层级和导航模式,直接影响生成式引擎解析和理解全局文档组织的方式。

  • 标题层级深度: dh,测量嵌套层级数
  • 分支因子: bh,每级标题下的子标题数
  • 层次平衡比: R = min(bh) / max(bh),取值接近 1 表示均衡分布
  • 逻辑连续索引: Tc,追踪概念在文档中的展开路径

中观结构特征

中观结构在段落级别运作,影响 LLM 如何从特定内容区块中提取和综合信息。

  • 段落长度方差: Vp,标准化段落长度方差
  • 格式多样性: Fd,列表/表格/代码块/纯文本等格式类型的香农多样性指数
  • 信息密度: D = 有意义词数 / 总词数

微观结构特征

微观结构关注句子级别的格式化,影响 LLM 对关键术语和概念的注意力分配。

  • 强调密度: Ed,使用粗体/斜体的句子比例

  • 强调位置熵: Ep,强调在句子内出现的分布特征

  • 关键词位置密度(Kp): 在注意力敏感位置的战略关键词放置,权重分配为:

    • 句首关键词:2.0x 权重
    • 段落边界(首句/末句)关键词:1.5x 权重
    • 标准位置关键词:1.0x 权重
  • 强调权重层级:粗体 > 斜体 > 下划线

B. 架构特定引用预测

不同的生成式引擎架构因其底层检索-生成机制的不同,表现出截然不同的结构偏好:

架构类型 最优先特征 权重 次优先特征 权重 第三特征 权重
Search-then-Synthesize 元结构清晰度 0.45 前置信息密度 0.30 层级深度 0.25
Iterative Refinement 交叉引用丰富度 0.41 层级广度-深度比 0.35 查询触发关键词 0.24
Integrated Search-Generation 分块独立性 0.38 格式多样性 0.35 激进分块 0.27

核心逻辑: 批量检索(Search-then-Synthesize)强调元结构和前置密度以便初始检测;多轮系统(Iterative Refinement)偏好能实现迭代精炼的交叉引用;实时架构(Integrated Search-Generation)则优化分块独立性以支持流式提取。

C. 五项结构优化基本原则

基于实证引用分析,我们建立了五项优化基本原则,每项均配有从跨架构预测模型中得出的定量目标:

原则 1:层级清晰度。 保持标题层级深度 dh ∈ [3, 5],非根级段落分布 bh(i) ≈ 0.3 ± 0.1。此范围来自对跨架构注意力机制行为的分析。过浅(dh < 3)无法提供足够结构引导;过深(dh > 5)会稀释注意力权重。

原则 2:信息密度优化。 目标段落长度 Lp = 120–200 词/段(中文对应约 180–300 字),段落长度方差控制在标准化范围内。过短段落(< 80 词)缺乏上下文丰富度;过长段落(> 300 词)降低 LLM 的提取精度。

原则 3:格式多样性。 维持格式多样性指数 Fd ≥ 0.5,在纯文本、列表、表格和结构化摘要之间取得平衡。纯文本文章(Fd = 0)的引用率系统性地低于那些融合多样性格式的文章。

原则 4:交叉引用连接度。 文档内交叉引用使平均概念图路径长度 ℓ < 3,创建小世界网络属性以支持跨所有生成式引擎架构的多跳推理。

原则 5:战略强调分配。 将粗体/斜体强调应用于前 20% 高重要性句子,优先放在句首位置(权重 2.0x)和段落边界(权重 1.5x)。过度强调(> 30% 句子)会稀释注意力权重并降低效果。

D. 层级转化框架

优化从宏观到微观逐层进行,每层的转化都受语义保留要求的约束:

宏观结构优化:

  • 标题层级深度优化:使用语义聚类进行合并,使用主题多样性分析进行拆分
  • 交叉引用优化:创建平均路径长度 ℓ < 3 的小世界网络属性

中观结构优化:

  • 段落重组:在主题转移边界处拆分过长段落;合并过于细碎的相关段落(语义相似度 > 0.65)
  • 格式转化:使用模式识别识别可转化内容,转化决策权重为:可解析性 0.5 + 信息密度 0.3 − 阅读流畅度干扰 0.2

微观结构优化:

  • 重要性评分 = 0.5 × TF-IDF + 0.3 × 中心度 + 0.2 × 位置
  • 对前 20% 高重要性句子施加战略强调
  • 关键词按位置权重分配粗体/斜体格式

E. 多架构目标优化

当内容需要面向多种架构时,采用多目标优化公式:

SF* = arg max Σ αA · P(cite | SF, A)
        A∈Atarget

其中 αA 表示基于目标平台分布的架构重要性权重。

例如标题深度目标:

d_target_h = 4.0 + αSTS·(+0.5) + αIR·(0.0) + αISG·(−0.5)

反映了 Search-then-Synthesize 偏好更深层级(dh ≈ 4.5),Iterative Refinement 保持中性(dh ≈ 4.0),Integrated Search-Generation 偏好更浅结构(dh ≈ 3.5)。

此公式将核心结构原则(跨架构通用)与架构适应性(修正参数)分离,在保持普适性的同时实现针对性优化。


第五章 实验评估

A. 引用性能

下表展示了结构优化的聚合结果:

架构类型 基线引用率 (%) 优化后引用率 (%) 基线可见性 优化后可见性 提升幅度 (%)
Search-then-Synthesize 43.7 52.1 0.401 0.481 +19.2
Iterative Refinement 52.3 59.6 0.474 0.541 +14.0
Integrated Search-Generation 39.1 46.8 0.358 0.428 +19.7
总体平均 45.0 52.8 0.411 0.483 +17.3

p < 0.001,配对 t 检验,n = 200,Cohen’s d = 0.64

结构优化在所有架构上都产生了显著的提升(14%–20%,均值 17.3%),其中 Search-then-Synthesize 和 Integrated Search-Generation 的增益更高,反映了这些架构对结构特征的敏感性。Iterative Refinement 架构虽因穷举式多轮搜索而具有更高基线引用率,仍通过交叉引用网络优化实现了有意义的提升(14.0%)。中等至大型效应量(Cohen’s d = 0.64)表明具有实际意义。

B. 主观印象评估

评估维度 基线得分 GEO-SFE 得分 提升幅度 (%)
相关性(Relevance) 18.7 ± 2.8 22.3 ± 2.5 +19.3
影响力(Influence) 17.5 ± 3.2 23.1 ± 2.7 +32.0
独特性(Uniqueness) 21.3 ± 2.2 23.6 ± 2.0 +10.8
主观位置(Subj. Position) 19.1 ± 2.9 22.8 ± 2.6 +19.4
主观数量(Subj. Count) 20.8 ± 2.5 23.4 ± 2.3 +12.5
点击概率(Click Probability) 17.2 ± 3.4 22.6 ± 2.9 +31.4
多样性(Diversity) 22.1 ± 2.1 23.7 ± 1.9 +7.2
整体平均 19.5 ± 1.7 23.1 ± 1.4 +18.5

所有提升在 p < 0.001 水平上显著(配对 t 检验,n = 200)

结构优化在所有主观维度上都产生了显著提升(平均 +18.5%)。影响力(+32.0%)和点击概率(+31.4%)增益最大,反映了宏观结构清晰度如何增强叙事权威性,以及中观结构格式化如何改善视觉吸引力。

C. 消融分析

消融实验揭示了每个结构层级的独立贡献:

  • 宏观结构单独优化: +8.2% 引用率提升
  • 中观结构单独优化: +6.1% 引用率提升
  • 微观结构单独优化: +4.9% 引用率提升
  • 三层全部(GEO-SFE 完整): +17.3% 引用率提升

三层效果并非简单叠加(8.2 + 6.1 + 4.9 = 19.2 > 17.3),表明层级间存在部分重叠/协同效应,但每个层级都有独立的、不可替代的贡献。


第六章 讨论与结论

本研究建立了结构特征工程作为 GEO 学科的基石组成部分,为内容创作者提供了科学依据的方法论以在"引用经济"中导航——在这个新范式中,可见性取决于算法理解而非传统的排名指标。

关键发现:

  1. 内容结构独立于语义内容,对 LLM 引用行为产生可量化的、系统性的影响
  2. 不同生成式引擎架构展现出不同的结构偏好,需要架构感知的优化策略
  3. 宏观-中观-微观三层框架提供了覆盖全面的优化杠杆
  4. 17.3% 的引用率提升和 18.5% 的主观感知质量提升,证明了结构优化的实际价值

局限性与未来工作:

  • 当前实验基于英文内容,跨语言结构通用性有待验证
  • 生成式引擎架构持续快速演进,需要持续跟踪和更新结构偏好模型
  • 需要探索结构优化与语义优化的协同效应(当前仅研究结构独立效应)

参考文献

[1] P. Aggarwal et al., “GEO: Generative Engine Optimization,” in Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining, 2024, pp. 5–16.

[2] P. Lewis et al., “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,” Advances in Neural Information Processing Systems, vol. 33, pp. 9459–9474, 2020.

[3] R. Nakano et al., “WebGPT: Browser-Assisted Question-Answering with Human Feedback,” arXiv preprint arXiv:2112.09332, 2021.

[4] R. Thoppilan et al., “LaMDA: Language Models for Dialog Applications,” arXiv preprint arXiv:2201.08239, 2022.

[5] A. Kumar and H. Lakkaraju, “Manipulating Large Language Models to Increase Product Visibility,” arXiv preprint arXiv:2404.07981, 2024.

[6] Z. Yang et al., “Hierarchical Attention Networks for Document Classification,” in Proceedings of NAACL-HLT, 2016, pp. 1480–1489.

[7] A. Vaswani et al., “Attention Is All You Need,” Advances in Neural Information Processing Systems, vol. 30, 2017.

[8] S. Ray, “How Generative Engines Are Rewriting Search - Literally!” Medium, May 2025.

[9] Weka Team, “Retrieval Augmented Generation: Everything You Need to Know About RAG in AI,” Weka.io, October 2024.

[10] D. Tank, “Understanding RAG-Fusion: Next-Level Retrieval-Augmented Generation,” Medium, April 2025.

[11] Z. Rackauckas, “RAG-Fusion: A New Take on Retrieval-Augmented Generation,” arXiv preprint arXiv:2402.03367, 2024.

[12] Microsoft Cloud Team, “Common Retrieval Augmented Generation (RAG) Techniques Explained,” Microsoft Documentation, 2025.

[13] Various, Query Rewriting Architecture Documentation, 2025.

[14] Various, Multi-Hop and Graph-Web Hybrid Architecture Documentation, 2025.

[15] Various, Real-Time Web Architecture Documentation, 2025.

[16] Various, HyDE Web Architecture Documentation, 2025.

[17] Various, Vertical Domain Architecture Documentation, 2025.

[18] Industry Report, AI Overviews Impact Analysis, 2025.

[19] Industry Report, Zero-Click Search Statistics, 2025.

[20] Industry Report, SEO to GEO Transition Analysis, 2025.

[21] Industry Report, User Behavior in LLM-Powered Search, 2025.


中文翻译完成于 2026-06-17 | 原文 arXiv:2603.29979v1 | 东京大学/筑波大学/广岛大学