跳转到内容

衡量LLMO:引用率、提及密度与AI推荐转化

LLMO衡量是追踪AI系统是否引用你的内容、引用深度如何,以及这些引用对你的业务价值如何的实践。它取代了传统SEO的排名位置KPI,这些KPI在AI搜索中没有等价物:没有第1到第100位,只有被引用或未被引用。

SEO衡量是一个已解决的问题:Google Search Console每天免费报告排名、展示量、点击量和CTR。LLMO没有等价工具。截至2026年,没有任何AI平台——OpenAI、Anthropic、Google或Perplexity——提供官方API来报告你的站点被引用的频率。

两个后果:

  1. GA4推荐流量只是冰山一角。 当AI引用你且用户点击链接时,GA4会记录一次推荐。当AI引用你但没有人点击——这是大多数情况——任何你可见的地方都不会有记录。一个从未被点击的引用仍然将你定位为答案中的来源,并且这种效果会累积。
  2. 第三方追踪工具的数据差异极大。 一项受控比较将同一站点在15天内输入七个AI引用追踪工具,得到了七个不同的数字,从38到312——8.2倍的差距(完整记录,英文)。这种分歧是定义问题,而非供应商缺陷:工具在什么算作引用(带链接来源vs.任何品牌提及)、采样哪些LLM、采样频率以及采样语言方面存在差异。

由此得出的实用规则:在购买或构建任何追踪工具之前,用一句话写下你对”引用”的定义。 如果你关注归因流量,只计算带链接的引用。如果你关注品牌存在感,计算提及次数。这两个数字在不同定义之间不可比较。

SOV(声量份额)和SOM(模型份额)等宏观指标告诉你整体AI存在感是否有所变化,但不会告诉你下一步该做什么。对于改进周期,分解为三个指标:

指标衡量内容单位频率
引用率AI在固定提示集上提及你的频率%每周
品牌提及密度AI提及你时的深度每千词提及次数每月
AI推荐转化AI推荐访问的价值%每月

三者共同覆盖频率、深度和价值——单纯的引用计数会将三者混为一谈。

在你关注的AI平台上运行固定的10–20个提示集,衡量你的品牌或域名出现在运行结果中的比例:

引用率 = 提及次数(提示×平台) / 总运行次数 × 100

10个提示 × 5个平台 = 50次运行;12次提及 = 24%。

提示集必须保持冻结。LLM的响应是非确定性的——同一提示在不同日期会产生不同答案——因此单次检查就是噪音。在不变的提示集上追踪趋势至少4周,然后再从中解读任何信息。

引用率是每次运行的二元值:提及或未提及。但引用的深度各不相同——“其他选项包括X”一带而过的价值远低于解释你方法的一个段落。提及密度衡量每1,000个答案词中品牌术语出现的次数:

def mention_density(answer_text: str, brand_terms: list[str]) -> float:
total_words = len(answer_text.split())
mentions = sum(answer_text.lower().count(t.lower()) for t in brand_terms)
return mentions / total_words * 1000

一次深度引用通常胜过一堆浅层引用。密度是你看到差异的方式。

在GA4中,创建一个频道组(管理员→频道组),使用以下会话来源正则表达式:

chatgpt\.com|perplexity\.ai|claude\.ai|gemini\.google\.com|copilot\.microsoft\.com

然后将此细分的转化率与自然搜索进行比较。实测数据持续发现AI推荐访客的转化率是自然搜索的数倍——2026年行业数据报告为8–12% vs. 自然搜索的2–3%,我们自己的参考站点追踪范围为自然搜索的2–4倍(衡量设置,英文)。机制在于:向AI询问”X应该用什么”的用户比在Google输入关键词的用户在决策过程中更靠后。AI已完成研究;点击离决定更近。

已知盲点:免费版ChatGPT用户通常不发送referrer,因此他们的点击落入”直接”流量。你的GA4 AI数字是下限,而非上限。

从与你资源匹配的层级开始;每个层级增加分辨率。

第一层:GA4频道组(免费,5分钟)

Section titled “第一层:GA4频道组(免费,5分钟)”

上述正则表达式。只衡量点击——冰山一角——但可验证,只需五分钟。

第二层:手动五平台协议(免费,每月30分钟)

Section titled “第二层:手动五平台协议(免费,每月30分钟)”

在每月固定的一天,在ChatGPT、Perplexity、Gemini、Claude和Copilot上运行你的10–15个冻结提示。每次运行记录:是否提及(是/否)、上下文(推荐/比较/中性/负面)、准确性,以及是否提供了URL。计算引用率。手动且繁琐——但仍然是最可靠的方法,因为没有自动化工具能判断一次提及是推荐还是贬低。

第三层:通过API自动化(半天时间,约每月1–8美元)

Section titled “第三层:通过API自动化(半天时间,约每月1–8美元)”

手动协议的脚本化版本:

BRAND_TERMS = ["your-site.com", "Your Brand"]
CHECK_QUERIES = ["Best tools for <your category>", ...] # 冻结集
def check(query: str, ask) -> dict:
answer = ask(query) # OpenAI / Anthropic / Perplexity API调用
return {
"query": query,
"mentioned": any(t.lower() in answer.lower() for t in BRAND_TERMS),
"density": mention_density(answer, BRAND_TERMS),
"snippet": answer[:300],
}

通过cron每周运行,追加到JSON或CSV时间序列。8–12周后,你可以将变化归因于具体干预:“添加结构化数据后,引用率从12%上升到28%“——这是第三层让你能说出的句子。

服务器访问日志已经记录了哪些AI系统访问你的内容——GPTBot、ClaudeBot、PerplexityBot和Google-Extended都在User-Agent中标识自己:

Terminal window
grep -E "GPTBot|ClaudeBot|PerplexityBot|Google-Extended" access.log \
| awk '{print $7}' | sort | uniq -c | sort -rn

从未被爬取的页面无法从实时索引中被引用。爬取频率是间接但领先的指标:它告诉你AI系统在引用数据出现之前正在跳过哪些内容。

没有行动的衡量是数据囤积。可持续的节奏:

  • 每周(10分钟): 检查GA4 AI频道和引用率变化;标记产生异常深度引用的提示。
  • 每月(30分钟): 审查提及密度趋势和AI推荐转化与自然搜索的对比;列出仍处于零引用的提示。
  • 每季度(1小时): 全面审查——更新查询集,检查内容变化是否产生了可衡量的变化。

优先处理零引用提示。将一个提示从0%提升到10%几乎总是比将30%的提示提升到40%更便宜,因为零通常有结构性原因——没有页面针对该问题,或者相关页面违反了知识清晰度检索信号原则。

本页的指标衡量结果:AI是否实际引用你。LLMOFramework Score衡量基础:你的站点的机器可读接口是否到位。基础检查是即时且确定性的;结果指标是缓慢且嘈杂的。两者都运行——用基础找出需要修复的内容,用结果确认修复是否有效。

  • 在采用任何工具之前,已用一句话定义”引用”
  • 已写下并冻结10–20个查询的提示集
  • GA4已配置带有推荐来源正则表达式的AI搜索频道组
  • 引用率按固定节奏追踪(每周或每月)
  • 提及密度将深度引用与浅层提及区分开来
  • AI推荐转化与自然搜索对比,而非单独查看
  • 已检查AI系统从未访问的页面的爬虫日志
  • 零引用提示驱动内容积压