那篇被同行评审的 GEO 论文,到底证明了什么

那篇被同行评审的 GEO 论文,到底证明了什么

你大概刷到过这类广告:"用了我们的 GEO 服务,AI 推荐率涨了 300%。"数字很诱人,但你没法验证——它既不公开方法,也不给原始数据。

好在 GEO 领域有一篇经同行评审、方法透明、可复现的实证研究:普林斯顿大学 Aggarwal 等学者的《GEO: Generative Engine Optimization》(arXiv:2311.09735,KDD 2024)。它把"哪种内容改动能提升被 AI 引用"这件事,从信念变成了可测量的实验。这篇 S3-1,就是把这篇论文的实测结果,翻译成你做决策用得上的判断。

为什么你该关心这篇论文

如果你决定认真做 GEO,你最不想把预算花在无效动作上。市面上的"效果神话"大多无法独立验证,而这偏偏是唯一一篇被顶级会议审稿、把九种做法逐一测出量化效果的论文。它可以当你的"避坑地图":告诉你哪些是真有用,哪些是白费力气。

它怎么测的

论文搭了一个叫 GEO-Bench 的基准:

  • 1 万条真实查询,覆盖 25 个领域(健康、金融、法律、历史、科学等),其中 80% 是信息类问题。
  • 对每条查询,取搜索结果 Top-5 作为"候选来源池",对其中的一个来源施加某一种 GEO 策略,再让生成式引擎重跑答案,测量这个来源在答案里的可见度变化。
  • 衡量指标有两个:一是按引用位置加权的被引字数(论文叫 Position-Adjusted Word Count,越靠前权重越高),二是由模型打分的主观印象分
  • 方法边界要先说清:主实验用 GPT-3.5 作生成引擎的"代理",并用已上线的 Perplexity 做交叉验证。也就是说,绝对数值会随引擎演进漂移,但方向性结论稳健。

九种做法,哪些真的有用

论文测了九种策略。先说结论里最该记住的一点:真正拉高被引可见度的,是"给证据"这一类动作,不是"装专业"。

表现最好的几类做法——添加权威引述(Quotation)、加入量化数据(Statistics)、内联引用来源(Cite Sources)——把被引可见度比基线最高提升了约 40–41%(基线 PWC 19.3,表现最好的一组到 27.8 左右)。拆开看:

  • 添加权威引述(Quotation):平均提升最大,论文里绝对分数最高的一组。
  • 加入量化数据(Statistics):紧随其后,前提是数据得附可验证来源。
  • 内联引用来源(Cite Sources):跨领域普遍有效,而且它有一个更惊人的长尾效应(下面单独说)。
  • 流畅度优化(Fluency):只改文风、不动内容,也能拿到接近前两名的提升——说明"好读"本身就有价值。

反过来,这几类基本没用甚至有害:

  • 权威语气(Authoritative):你以为"显得专业、有说服力"会有用,论文发现它几乎无提升。原因很实在——生成引擎已经对我们的"话术"比较免疫了。
  • 独特用词(Unique Words):接近 0 效果。
  • 关键词堆砌(Keyword Stuffing):传统 SEO 的看家本领,在 GEO 里不仅无效,在 Perplexity 上还比基线差约 10%

为什么"给证据"比"装专业"有用

这里有个值得想清楚的推理链。

生成式引擎在合成答案时,要决定采信哪个来源。它内部有一套"这个值不值得引"的判断。真实引用和量化数据,直接降低了引擎的核验成本、提高了内容的可信度——相当于你替它把"查证"这一步做了一半。而"权威语气"只是语气,不增加任何可被核验的信息量,引擎自然不为所动。

这对你的启示很直接:别在"显得专业"上花力气,要在"给出可被验证的证据"上花力气。 预算有限时,优先级应该是 内联引用 + 可验证数据 > 话术包装。

排第五名,反而可能更赚

这是论文里最反直觉、也最对小品牌友好的发现。

把"可见度提升"按来源原本的排名拆开看:内联引用(Cite Sources)对原本排第 5 的来源,带来了 +115.1% 的可见度提升(添加引述 +99.7%、加数据 +97.9% 同量级)。越靠后的来源,一次成功的优化带来的"相对增益"越大。

原因也好理解:生成式引擎为了平衡观点,会在 Top-5 之外也吸纳多样化来源。对排第 3–5 的来源,一次优化可能让它从"偶尔被引"变成"稳定被引",相对增幅自然夸张。

这意味着:中小品牌和垂直领域玩家,反而比挤头部红海的大站更该做 GEO。 你不必和巨头抢第一,把垂直领域的权威内容做好、加上规范引用,被 AI 选中的概率提升空间最大。

你现在就能做的三件事

不用等预算,今天就能动手:

  1. 给关键主张补"出处":在重要说法后面加可点击的引用链接(论文、法规、官方文档),方便 AI 溯源。
  2. 把"显著提升"改成"具体数字 + 来源":别写"效果很好",写"某指标从 X 到 Y(来源 Z)"。
  3. 流畅化排版:用清晰的标题、列表、表格降低 AI 的抽取成本——这是论文里"流畅度优化"证实有效的零成本动作。

我的判断

  1. GEO 不是玄学,是工程问题。 凡拿不出可验证数字的"效果神话",先打问号。
  2. 给证据 > 装专业。 同样的精力,投在"内联引用 + 可验证数据"上回报最高。
  3. 小站和垂直品牌更该做 GEO。 长尾再分配对靠后的来源最有利,这是大站享受不到的红利。

信息来源 来源 等级 用途 链接 Aggarwal 等《GEO: Generative Engine Optimization》arXiv:2311.09735,KDD 2024 T1 九策略与全部量化数据底座 https://arxiv.org/abs/2311.09735 同上,Perplexity 交叉验证实验(论文第 6 节) T1 方法边界与关键词堆砌负向结论 https://arxiv.org/html/2311.09735

本文撰写时使用了AI技术辅助。若发现有事实错误或其他建议,请与站长反馈,反馈邮箱fudonglee@vip.qq.com