大语言模型中的文化编码:AI 中介品牌发现的存在差距
摘要
随着人工智能系统日益增多地中介消费者信息发现,品牌正面临算法不可见的挑战。本研究调查大语言模型(LLMs)中的文化编码——源于训练数据组成引起的品牌推荐系统性差异。分析 1909 条纯英文查询,涵盖 6 个 LLMs(GPT-4o、Claude、Gemini、Qwen3、DeepSeek、Doubao)和 30 个品牌,发现中文 LLMs 的品牌提及率比国际 LLMs 高出 30.6 个百分点(88.9% vs. 58.3%,p<.001)。这一差异在相同英文查询中依然存在,表明是训练数据的地理分布——而非语言——驱动此效应。我们提出了存在差距(Existence Gap)概念:训练语料库中缺失的品牌在 AI 回应中不存在“存在”,无论其质量如何。通过Zhizibianjie( OmniEdge),一个在中文 LLMs 中提及率达 65.6% 而国际模型中为 0% 的案例研究,我们展示了语言边界障碍如何创建不可见的市场进入障碍。理论上,我们贡献了“数据护城河框架”(Data Moat Framework),将 AI 可见内容概念为一种 VRIN 战略资源。我们将“算法普适性”(Algorithmic Omnipresence)——品牌在 LLM 知识库中全面可见—— operationalize 为生成式引擎优化(GEO)的战略目标。实务上,我们提供了 18 个月的路线图,指导品牌通过语义覆盖、技术深度和文化本地化构建数据护城河。我们的发现表明,在 AI 中介的市场中,品牌数据边界的限制定义了其市场前沿的限制。
引用
@article{arxiv.2601.00869,
title = {Cultural Encoding in Large Language Models: The Existence Gap in AI-Mediated Brand Discovery},
author = {Huang Junyao and Situ Ruimin and Ye Renqin},
journal= {arXiv preprint arXiv:2601.00869},
year = {2026}
}
备注
19 pages, 5 tables. Dataset and code available at https://github.com/zhizibianjie-omniedge/geo-cultural-encoding