多语言LLMO
翻译内容是必要的,但并不充分。 在2026年,“我发布了葡萄牙语版本”和”AI搜索引用我的葡萄牙语版本”之间存在真实可测量的差距。本指南涵盖LLMO需要解决的两个多语言问题:让AI引擎引用正确的语言版本,以及决定哪些语言值得投入。
错误语言引用问题
Section titled “错误语言引用问题”传统搜索引擎先确定提供哪个文档,再提供它。hreflang是其调整了二十年的排名信号,Google在选择匹配语言URL方面确实很出色。
基于LLM的引擎做的事情不同:检索少数几个文档,用用户的语言生成答案,然后附上检索层浮现的任何URL。生成步骤是流畅的多语言处理。语言选择发生在检索步骤——而这一步经常偏向英语。
可观察到的结果,来自对同一多语言查询的跨引擎测试(Glenn Gabe, GSQI)和一个四语言站点自己的引用追踪:
- Google支持的引擎(AI Overviews、AI Mode、Gemini、Copilot)继承了数十年的
hreflang处理经验,大多数情况下会引用正确的本地化URL。 - Perplexity即使设置为偏好法语,仍然返回了美国英语页面。
- ChatGPT用法语写出答案,然后链接了该页面的英语版本。答案使用读者的语言;引用却不是。
检索层默认使用英语的原因:
- 英语版本通常拥有更多入站链接和更长的爬取历史,因此无论读者的语言如何,在检索索引中排名更高。
- 许多AI爬虫不像Googlebot那样完整解析
hreflang集群。 - 翻译质量是信任信号。如果翻译页面读起来像机器输出,检索层会将其视为低置信度的重复内容,转而选择英语原版。
失败不在于”AI不会说葡萄牙语”。而在于”AI的检索层不够信任你的葡萄牙语页面去引用它”。
真正有效的措施,按排名
Section titled “真正有效的措施,按排名”来自一个四语言站点的单变量实验(实测报告,英文):
hreflang+x-default——效果最大。 每个语言版本必须声明完整的集群,并设置合理的x-default。这是Google支持的引擎可靠读取的一个信号,而这些引擎占AI搜索的很大份额。如果只做一件事,就把这件事做好。- 每语言自引用canonical——悄悄至关重要。 每个语言版本必须canonical到自身,而非英语原版。canonical指回英语的翻译页面是在告诉每个爬虫”真正的页面是英语版本”——这是自我造成的伤害。
- 每语言
llms.txt——小投入,可能值得。 按语言整理链接,使每个文件指向正确的本地化URL。目前尚无主要引擎确认权重这一点,但每种语言只需十五分钟,零风险,并且记录了哪个URL是每种语言的规范版本。 - 尝试配置引擎——毫无效果。 没有任何设置可以让ChatGPT引用你的本地化URL。你无法通过配置摆脱检索偏见;你只能向检索层提供更清晰的信号并等待。
即使所有信号都已清理,也预期会有残余差距:部分失败存在于你不拥有的检索层内部。你可以缩小差距,但无法完全消除它。
语言不对称性:战略机遇
Section titled “语言不对称性:战略机遇”导致错误语言引用的同一种不成熟,创造了机遇。AI搜索竞争在不同语言间极为不均衡,而LLMO基础在LLMO基础还罕见的语言中复利最快。
对一个在四种语言中发布相同内容的博客进行22天GA4测量(实测报告,英文):
| 语言 | 页面浏览量 | 文章数 | 备注 |
|---|---|---|---|
| 葡萄牙语 | 748 | 17 | 文章更少,约为英语的3.8倍 |
| 英语 | 195 | 26 | 饱和市场,声量份额小 |
| 日语 | 27 | 25 | 读者活跃在平台(Qiita/Zenn),而非博客 |
| 西班牙语 | 7 | 10 | 竞争薄弱但无社区入口 |
语言不对称性可以完全吞噬文章数量不对称性。 三种不对称性叠加产生了葡萄牙语的结果:
- 社区入口——一个让无名作者能在同一天被阅读的每语言开放平台(巴西有TabNews;英语没有类似底线的等价物)。
- 更薄的AI搜索领域——在葡萄牙语中,竞争同一提示的候选者少得多。在供应不足的语言中,第一个合理答案就能获胜;英语中的第一个合理答案则会被埋没。
- 先发优势基础——在大多数该语言站点什么都不提供的情况下,
/pt/llms.txt有一定的差异化效果;在英语中,同一个文件只是基本卫生操作。
每种语言的分发模式也不同:日语结果表明,在该语言中,博客应该作为AI爬虫索引的规范档案,而平台帖子(Zenn/Qiita)完成人类流量工作。相同的内容,完全相反的角色。
- 在翻译之前确定每个目标语言的社区入口。 不是受众规模——而是入口。如果没有开放发布平台,预期会出现上面的西班牙语结果。
- 从第一天起提供
/{lang}/llms.txt。 每种语言十五分钟;这是在供应不足语言中可用的最便宜差异化手段。 - 在发布前设置带语言前缀过滤器的分析工具,否则你将在第二个月而非第一天进行回溯性测量。
- 首先翻译前20%的文章——最可能在社区入口成功的文章。在翻译整个档案之前验证分发效果。
- 按语言将AI搜索声量份额作为独立KPI追踪。 每月在ChatGPT、Perplexity和Claude的每种语言中运行相同的品牌相关提示(指标见衡量LLMO)。这种不对称性是真实的,在测量之前是不可见的。
- 手动编辑机器翻译,注意语域和地方习惯。 翻译质量是检索信任信号,不仅是对读者的礼貌。
本站的实施方式
Section titled “本站的实施方式”llmoframework.com以英语为规范来源发布8个语言版本。没有翻译的页面以英语内容作为回退,并设置noindex和sitemap排除——未翻译的页面不应在任何检索索引中与其自身规范页面竞争。每个语言版本都声明完整的hreflang集群和自引用canonical。
- 每个语言版本都声明包含
x-default的完整hreflang集群 - 每个语言版本都有自引用canonical(绝不指向英语原版)
- 每个语言目录都有自己的
llms.txt,包含本地化URL - 未翻译的回退页面已设置
noindex并从sitemap中排除 - 翻译已针对语域和地方习惯进行手动编辑,而非原始机器输出
- 在翻译开始前已确定每个目标语言的社区入口
- AI搜索声量份额按语言、用该语言每月测量
- 发布精力向供应不足的语言倾斜,而非总说话人数