文化无处不在:致意图性文化评估的呼声
计算与语言
2025-09-25 v2
摘要
用于评估大型语言模型(LLM)文化对齐程度的当前“以琐事为中心的范式”正在变得不足,因这些模型正在变得更加先进且广泛部署。现有方法通常将文化简化为静态事实或价值观,通过多项选择题或简答题来测试模型,将文化视为孤立的琐事。此类方法忽略了文化的多元主义和互动性,忽视了文化假设如何渗透甚至看似“中性”的评估环境之中。本论文提出了“意图性文化评估”方法:系统性地检查评估各方面所嵌入的文化假设,而不仅仅局限于明确的文化任务。我们系统性地刻画了文化考虑因素在评估中的“何时、如何、以及何种情况下”出现,强调研究者立场对于培育包容性、文化对齐的 NLP 研究的重要性。最后,我们讨论了超越当前基准测试实践的意义与未来方向,发现尚未知晓的重要应用,并通过受 HCI 启发的参与式方法性质,涉及社区参与评估设计。
引用
@article{arxiv.2509.01301,
title = {Culture is Everywhere: A Call for Intentionally Cultural Evaluation},
author = {Juhyun Oh and Inha Cha and Michael Saxon and Hyunseung Lim and Shaily Bhatt and Alice Oh},
journal= {arXiv preprint arXiv:2509.01301},
year = {2025}
}