文化真实性:比较 LLM 文化表征与本土人类期望
计算与语言
2026-04-07 v1
摘要
大型语言模型(LLM)输出中的文化表征主要通过文化多样性和事实准确性等代理指标进行评估。然而,评估文化对齐度的关键缺口仍然存在:即生成内容与本土人口如何看待和优先考虑其自身文化方面的程度。本文引入一种以人类为中心的框架来评估 LLM 生成内容与当地期望的对齐程度。首先,我们建立了一个基于从九个国家收集的开放式调查响应中提炼出的文化相关方面集合,构成的以人类为来源的文化重要性向量。随后,我们引入一种方法来计算基于语法多样化提示集的 LLM 的文化表征向量,并将其应用于三个前沿 LLM(Gemini 2.5 Pro、GPT-4o 和 Claude 3.5 Haiku)。我们调查人类来源的文化重要性与模型来源的文化表征之间的对齐情况,发现某些模型存在西方中心校准,其中对齐度随文化距离离美国越远而降低。此外,我们识别出所有模型中高度相关的系统性错误特征(ρ > 0.97),这些特征过度关注某些文化标记,而忽略用户深层的社会和价值优先事项。我们的做法超越简单的多样性指标,评估 AI 生成内容在真实捕捉全球文化细致层次方面的忠实度。
引用
@article{arxiv.2604.03493,
title = {Cultural Authenticity: Comparing LLM Cultural Representations to Native Human Expectations},
author = {Erin MacMurray van Liemt and Aida Davani and Sinchana Kumbale and Neha Dixit and Sunipa Dev},
journal= {arXiv preprint arXiv:2604.03493},
year = {2026}
}
备注
18 pages, 4 figures