Skip to content
阅读进度0%
Prompt待复核

GEO 到底怎么做?从 Prompt 研究到 AI Citation 的完整落地方法

CSDN 原文全文镜像:用户真正会问什么?↓AI 现在怎么回答?↓AI 为什么引用这些 Source?↓为什么竞争对手有,我没有?↓↓修改之后重新跑 Dataset↓Research↓Measure↓Analyze↓Optimize↓Evaluate↓Lear……

CSDN 原文镜像

本文为作者 CSDN 博客的全文镜像,原文发布于 2026-08-24。为适配本站结构,仅补充了站内元数据与来源说明,正文主体保持原文内容。

在这里插入图片描述

前面介绍 GEO 时,我们很容易把它理解成:

把文章写得更适合 ChatGPT、Gemini、Perplexity 这些 AI 引用。

但真正研究一圈 GEO 厂商和开源项目之后,会发现:

这其实只是 GEO 很小的一部分。

Profound、Peec AI、Scrunch 等商业产品,以及 Elmo、Gego 这些开源项目,真正投入最多的能力都不是“帮你改几段文章”,而是:

Prompt 监测、品牌可见度、Citation 分析、Source Gap、Crawler 访问、竞品分析以及持续复测。

例如 Profound 的核心流程,就是围绕真实 Prompt 建立每日监测,记录不同 Answer Engine 的完整回答、引用来源以及品牌可见度;Peec 则进一步把 Brand Visibility 和 Source Visibility 分开分析;开源项目 Gego 和 Elmo 也都采用“定时执行 Prompt → 保存 Answer → 提取 Mention/Citation → 做趋势分析”的基本架构。

所以如果重新定义 GEO,我更愿意把它描述成:

GEO 是围绕生成式搜索建立的一套 AI Visibility Engineering。

它要解决的不是一个问题,而是一条完整链路:

text
用户到底会问什么?

AI 现在怎么回答?

AI 为什么引用这些网站?

为什么竞争对手出现了,我没有?

应该改网站、改内容,还是建设外部信源?

修改之后有没有真的变好?

真正的 GEO,就从这里开始。


一、第一步不是写内容,而是建立 Prompt Dataset

传统 SEO 的起点通常是:

text
Keyword Research

GEO 的起点应该变成:

text
Prompt Research

这是两者之间一个非常重要的变化。

例如你是一家企业 RAG 产品厂商。

传统 SEO 可能会关注:

text
RAG
RAG Platform
RAG Framework
企业知识库
RAG SaaS

但是用户使用 ChatGPT 时,很少只输入:

text
RAG Platform

更可能直接问:

text
企业内部知识库应该怎么做?

有哪些比较成熟的企业 RAG 平台?

LangChain 和 LlamaIndex 哪个更适合企业?

有哪些支持私有化部署的 RAG 产品?

金融行业做 RAG 应该注意什么?

RAG 准确率低一般是什么原因?

有没有支持权限控制的企业知识库方案?

这意味着我们真正需要建立的是:

text
              RAG Prompt Universe


┌───────────┼───────────┐
│           │           │
Information   Comparison   Recommendation
│           │           │
是什么?       A vs B       推荐哪些?
为什么?       谁更好?      哪个最好?


┌───────────┼───────────┐
│           │           │
Problem     Commercial   Transaction
│           │           │
怎么解决?     产品选型      买哪个?
为什么不准?   企业方案      多少钱?

然后继续增加几个维度:

text
Persona
├─ 开发者
├─ 架构师
├─ CTO
└─ 采购负责人

Region
├─ 中国
├─ 美国
└─ 欧洲

Language
├─ 中文
└─ 英文

最终得到的不是 20 个 Keyword,而可能是:

200~1000 个真实 Prompt。

这就是整个 GEO 系统的测试集。

Profound 现在甚至专门提供 Prompt Volumes 和 Prompt Research,用真实 AI 对话数据判断哪些问题真正有人在问,因为如果 Prompt 本身选错了,后面所有 GEO 优化都可能是在优化一个根本不存在的需求。

这其实和做 Agent Evaluation 很像:

没有 Dataset,就谈不上 Evaluation;没有 Prompt Dataset,同样谈不上 GEO。


二、第二步:建立 GEO Baseline,先知道 AI 现在怎么看你

有了 Prompt Dataset 以后,不要急着修改网站。

先跑一遍。

例如:

text
300 Prompts

×
ChatGPT
Gemini
Perplexity
Copilot
Google AI

×
不同地区

×
多次 Run

为什么一个 Prompt 要重复跑?

因为生成式回答不是传统搜索排名。

同一个问题:

text
有哪些优秀的 Agent Evaluation Framework?

今天 ChatGPT 可能回答:

text
LangSmith
DeepEval
Braintrust
Arize

明天可能变成:

text
LangSmith
Braintrust
Phoenix
DeepEval

Profound 就明确采用每日运行 Prompt 的方式,因为 Answer Engine 不会每次返回完全相同的答案。

所以每次 Run 至少要保存:

text
Prompt

Engine

Model

Region

Language

Raw Answer

Brand Mentions

Mention Position

Competitor Mentions

Citation URLs

Source Domains

Timestamp

最好不要只保存最终算出来的一个:

text
GEO Score = 82

而应该保留:

text
Raw Response

因为以后你的算法变了,还可以重新计算。

Gego 的实现就非常典型:

text
Scheduler

Worker

OpenAI / Anthropic / Google / Perplexity

Response

Citation Extraction

Brand Detection

Database

Analytics

它支持定时任务、Retry、Brand Alias、Citation URL、Top Cited Domain、Keyword × Domain 等分析,本质上已经是一套完整的 GEO Monitoring Backend。

Elmo 走的也是类似路线,而且把自己明确定位成开源 AI Visibility Tracking Platform。

所以 GEO 的第一套核心系统,其实不是 Content Generator。

而是:

AI Search Observability


三、第三步:不要只看“有没有我”,要分析 AI 为什么这么回答

有了数据以后,就可以开始算指标。

最基础的是:

Brand Visibility

例如一共执行了 1000 次相关 Prompt:

text
320 次回答出现你的品牌

那么:

text
Visibility Rate = 32%

然后是:

Citation Rate

text
1000 次回答

120 次引用你的官网

Citation Rate = 12%

再进一步看:

text
Share of Voice

Competitor A    48%

Your Brand      32%

Competitor B    26%

Competitor C    18%

还可以统计:

text
Average Mention Position

Citation Domain

Citation URL

Sentiment

Prompt Coverage

Model Coverage

但这里有一个非常重要的指标设计。

Peec AI 会把:

text
Brand Visibility

和:

text
Source Visibility

分开。

为什么?

因为这两个指标反映的是完全不同的问题。

比如:

text
AI 经常推荐你的品牌
但是很少引用你的官网

说明:

AI 知道你是谁,但是获取关于你的信息时主要依赖第三方网站。

反过来:

text
你的文章经常被引用
但是 AI 很少推荐你的品牌

说明:

你的内容有信息价值,但品牌和这个领域之间的 Entity Association 还不够强。

这两个问题的解决方法完全不一样。

第一个可能应该加强:

text
官网权威内容
产品文档
案例
数据
Original Research

第二个可能应该加强:

text
品牌 Entity
行业媒体
第三方评价
社区讨论
Benchmark
PR

所以真正成熟的 GEO 不能只有一个总分。

必须能够:

诊断。


四、第四步:做 Citation Intelligence,而不是看到排名低就疯狂改官网

这是 GEO 和传统 SEO 在执行层面非常不同的一个地方。

假设用户问:

有哪些优秀的 Agent Evaluation Framework?

AI 回答:

text
LangSmith
DeepEval
Braintrust
Arize

你自己的产品没有出现。

最简单粗暴的方法是:

马上写一篇《2026 最好的 Agent Evaluation Framework》。

但这不一定解决问题。

真正应该先做的是:

AI 为什么推荐了它们?

把所有回答的 Citation 拉出来。

可能会发现:

text
                     AI Answer


┌─────────────┼─────────────┐
│             │             │
GitHub         Reddit         G2
│             │             │
Star / Docs      Discussion     Review


Technical Blog / Media

这时候真正的问题就变成:

AI 在这个 Topic 下主要相信哪些 Source?

继续统计:

text
Top Citation Domains

reddit.com       18%
github.com       15%
g2.com           11%
某技术媒体          8%
竞品官网            7%

再看:

text
竞争对手被哪些页面推荐?

我是在哪些 Source 上缺席的?

这就是:

Source Gap Analysis

Peec 甚至会按照 Source Type 对引用来源进行分类,因为不同 Source 的解决方法完全不一样。

例如:

Source 类型GEO 动作
Own Website内容优化
EditorialPR / 媒体
UGCCommunity
Review用户评价
Corporate合作 / Directory
Reference权威资料 / 数据库

所以一个非常重要的认识是:

GEO 不是只优化自己的网站。

如果 AI 对某个问题主要参考:

text
Reddit
GitHub
G2
行业媒体
第三方 Benchmark

那么你官网再写 100 篇文章,也未必能够解决 Source Gap。

这也是为什么 GEO 最后一定会和:

text
SEO
+
Content Marketing
+
Digital PR
+
Community
+
Open Source

发生融合。


五、第五步:Technical GEO,保证 AI 真的能访问你

Source Gap 分析完之后,再回到自己的网站。

首先解决的不是文章写法,而是:

AI Search 到底能不能正常获取你的内容?

这一层我会称为:

Technical GEO

它和 Technical SEO 高度重合。

Google 在 2026 年发布的生成式 AI Search 指南已经明确说明,Google AI Overviews 和 AI Mode 仍然建立在核心 Search Ranking、Search Index 和 RAG Retrieval 机制之上,因此传统 SEO 的 Crawling、Indexing 和 Technical Structure 仍然是基础。

所以至少要检查:

text
robots.txt

Crawler Access

HTTP Status

Canonical

Index

Sitemap

Internal Link

JavaScript Rendering

SSR / SSG

Page Speed

Structured Data

Duplicate Content

对于 ChatGPT Search,OpenAI 官方也明确说明:

如果希望网页能够出现在 ChatGPT Search 的摘要和 Citation 中,需要允许 OAI-SearchBot 访问。

而且:

text
OAI-SearchBot

和:

text
GPTBot

用途并不相同。

这意味着企业完全可以根据自己的策略分别控制:

text
搜索发现



模型训练

这一点对企业网站尤其重要。

Scrunch 甚至专门把 Site Audit 拆成:

text
Access Control

Content Delivery

Content Quality

并进一步监控 AI Bot Traffic,看哪些 AI Crawler 真正在访问哪些页面。

所以真正成熟的 Technical GEO 应该进一步接入:

text
CDN Log

Nginx Log

WAF Log

然后统计:

text
Googlebot

OAI-SearchBot

Perplexity Bot

其他 AI Agent

究竟访问了:

text
哪些页面

访问多少次

状态码是多少

有没有被 WAF 拦截

有没有因为 JS 获取不到正文

这才是真正的:

AI Crawler Observability。


六、第六步:Content GEO,核心不是“AI 文风”,而是信息价值

解决完 Retrieval 问题以后,才轮到内容本身。

这里也是目前 GEO 最容易被做成玄学的地方。

网上经常可以看到:

text
多加 FAQ

多写数字

每 300 字切一次

多引用权威网站

写得更像百科

增加 llms.txt

然后包装成:

GEO 最佳实践。

但目前至少 Google 已经明确表示:

不需要为了 Google 的生成式搜索专门创建 llms.txt、特殊 AI Markup 或所谓 AI Chunking。Google 更强调的是传统 Technical SEO,以及独特、有价值、非同质化的内容。

所以真正值得优化的是四件事情:

text
Relevance

这个页面是不是真的回答了问题?


Information Gain

有没有别人没有的信息?


Evidence

重要结论有没有证据?


Extractability

信息是不是容易准确理解和提取?

例如这句话:

Reranker 可以明显提高 RAG 的准确率。

几乎没有什么信息价值。

但是如果写成:

text
测试规模:

120 万 Chunk

Embedding:

BGE-M3

Retriever:

Milvus

TopK:

30

Reranker:

BGE-Reranker

Without Rerank:

Recall@5 = 72.4%

With Rerank:

Recall@5 = 84.1%

代价:

P95 Latency
280ms → 510ms

然后再告诉读者:

text
为什么提升?

哪些 Query 提升最大?

哪些 Query 没提升?

为什么最终仍然上线?

测试数据有什么限制?

这篇内容就拥有了:

Information Gain

因为 AI 可以自己生成:

什么是 Reranker。

但是 AI 不知道:

你的生产环境中 Reranker 到底发生了什么。

Google 当前针对 Generative AI Search 也明确强调 Unique、Expert-led、Non-commodity Content,而不是简单批量生成已有信息的重新组织版。

因此 GEO 时代技术内容真正应该增加的是:

text
真实数据

Benchmark

源码

架构图

实验

失败案例

生产经验

第一手观察

而不是简单增加字数。


七、第七步:不要忽略 Query Fan-out

GEO 还有一个和传统 SEO 非常不同的地方:

AI 不一定拿用户原问题直接 Search。

例如用户问:

最好的企业 RAG 平台是什么?

后台可能进一步生成:

text
enterprise RAG platforms

secure enterprise RAG

RAG access control

RAG platform comparison

RAG deployment options

best RAG software 2026

这就是:

Query Fan-out

Google 已经公开说明 AI Search 中会使用 Query Fan-out,通过多个相关 Query 并行检索更多信息。

Elmo 现在也已经开始直接展示:

text
Prompt

AI 实际展开了哪些 Search Query

甚至分析:

text
AI 增加了哪些词

删除了哪些词

哪些 Fan-out Query 你没有覆盖

这意味着 GEO 内容策略不能只围绕:

text
Best RAG Platform

而应该继续覆盖:

text
Security

Pricing

Deployment

Access Control

Benchmark

Comparison

Integration

Review

所以 GEO 的内容结构最终会越来越像:

text
              Topic



Question Graph



Fan-out Query



Knowledge Network

这其实比传统 Keyword Expansion 更接近真实的 AI Retrieval。


八、第八步:修改以后一定要重新跑 Benchmark

这是整个 GEO 最重要,也最容易被忽视的一步。

很多所谓 GEO 服务是:

text
扫描网站

给你 73 分

AI 重写文章

发布

结束

但这不叫真正的优化。

因为:

你根本不知道修改有没有效果。

正确方式应该像做模型 Evaluation:

text
Baseline

提出 Hypothesis

修改

重新执行 Prompt Dataset

比较 Before / After

比如发现:

text
Prompt Cluster:

Agent Evaluation

Baseline Visibility:

18%

Citation Rate:

6%

然后你做了:

text
新增 Benchmark

补充 Agent Eval 方法论

增加 GitHub Example

完善 Structured Data

在几个高 Citation Source 获得真实 Mention

4 周后重新跑:

text
Visibility:

18% → 29%

Citation:

6% → 13%

这才说明:

修改可能有效。

如果:

text
18% → 17%

那就不能因为文章“看起来更 GEO”而自我安慰。

应该:

text
分析



Rollback / 调整



继续 Experiment

最终形成:

text
Experiment 001

Experiment 002

Experiment 003

...

然后逐渐得到:

什么策略对我的行业、我的网站、我的目标 Engine 真正有效。

这其实就是 GEO 最应该具备的科学性。


九、最终,GEO 应该形成这样一套系统

把前面的东西放在一起,一个完整 GEO Platform 可以设计成:

text
                 GEO Platform


Prompt Dataset


Multi-Engine Runner

┌─────────────┼─────────────┐
│             │             │
ChatGPT        Gemini      Perplexity
│             │             │
└─────────────┼─────────────┘

Response Store


Analysis Engine

┌──────────────┼──────────────┐
│              │              │
Mention        Citation       Fan-out
│              │              │
└──────────────┼──────────────┘

Competitor Graph


Gap Analysis

┌───────────┴───────────┐
│                       │
Owned Website           External Source
│                       │
Technical / Content      PR / UGC / Review
│                       │
└───────────┬───────────┘

Experiment


Re-run


Before / After

这时候 GEO 就不再是一套“内容优化技巧”。

而变成了:

一套围绕 AI Search 的可观测、分析、优化和实验系统。


十、最后总结:真正做 GEO,只需要记住这七步

如果把整篇文章压缩成一套可以直接执行的方法,就是:

text
1. Prompt Research

用户真正会问什么?


2. Baseline

AI 现在怎么回答?


3. Citation Intelligence

AI 为什么引用这些 Source?


4. Gap Analysis

为什么竞争对手有,我没有?


5. Optimization

Technical + Content + Off-site


6. Experiment

修改之后重新跑 Dataset


7. Measurement

Visibility / Citation / SOV / Traffic / Revenue

最终形成一个循环:

text
Research



Measure



Analyze



Optimize



Evaluate



Learn



Repeat

这才是我认为目前最合理的 GEO 方法论。


写在最后

如果一定要用一句话解释“GEO 到底怎么做”,我会说:

不要想办法让 AI“喜欢”你的文章,而是想办法让你的信息,在 AI 的 Retrieval、Context、Generation 和 Citation 链路里具备更高竞争力。

这两种思路差别非常大。

前者容易走向:

text
关键词

FAQ

Prompt Trick

llms.txt

固定模板

后者则会走向:

text
Prompt Dataset

AI Search Observability

Citation Graph

Source Gap

Information Gain

Entity Authority

Experiment

Evaluation

而真正有长期价值的 GEO,一定是后者。

SEO 时代,我们优化的是:

Page Ranking。

GEO 时代,我们正在开始优化:

Information Visibility。

所以真正需要建设的也不再只是一篇“SEO 文章”,而是一整套:

网站 + 内容 + Entity + 外部信源 + AI Search 数据 + Evaluation System。

这才是 GEO 真正开始变得有技术含量的地方。


参考资料

  1. Google Search Central:2026 年发布针对 AI Overviews、AI Mode 等生成式搜索功能的官方优化指南,强调传统 SEO、可抓取性和独特内容仍然是基础。

  2. Microsoft Bing Webmaster Tools:2026 年推出 AI Performance,可以查看 Total Citations、Grounding Queries、Page-level Citation 等 GEO 指标。

  3. OpenAI Publishers and Developers FAQ:介绍 OAI-SearchBot、ChatGPT Search 可发现性及 Citation 相关控制方式。

  4. Profound Answer Engine Insights:围绕 Prompt Tracking、Visibility、Citation 和 Share of Voice 建立 AI Search Monitoring。

  5. Peec AI:将 Brand Visibility 与 Source Visibility 分开,并基于 Citation Source 做 Gap Analysis。

  6. Elmo:开源 AI Visibility / GEO Monitoring 平台,支持多 Answer Engine 的 Mention、Citation 和竞品监测。

  7. Gego:开源 GEO Tracker,提供 Multi-LLM Prompt Scheduling、Citation Tracking、Brand Tracking 和 Analytics。

基于 VitePress 构建