随机性,而非表征:评估 LLM 文化对齐的可靠性
计算机与社会
2025-04-10 v2
摘要
随着对大型语言模型(LLM)‘文化对齐’的研究兴趣日益增长,人们正试图理解不同利益相关者之间的表征。当前基于调查的评估方法借鉴了社会科学方法论,往往忽视系统性的鲁棒性检验。本文我们识别并测试了当前基于调查的评估方法所基于的三个假设:(1)稳定性:文化对齐是 LLM 的属性,而非评估设计的副产品;(2)可外推性:一种文化在狭窄议题集合上的对齐,能否预测该文化在其他议题上的对齐;(3)可引导性:LLM 是否可靠地被引导去代表特定文化视角。通过实验检验领先 LLM 的显性与隐性偏好,我们发现跨呈现格式的高度不稳定性、在评估与未持有文化维度之间的不连贯性,以及在提示引导下异常行为。我们展示这些不一致性可能导致评估结果对方法论的微小变动极其敏感。最后,我们在一个案例研究中展示,狭窄的实验和选择性地评估证据可被用来描绘 LLM 文化对齐属性的不完整图景。总体而言,这些结果凸显了当前基于调查的方法在评估 LLM 文化对齐方面的显著局限,以及需要进行系统性鲁棒性检验和红队测试以评估结果的必要性。数据和代码分别可在 https://huggingface.co/datasets/akhan02/cultural-dimension-cover-letters 和 https://github.com/ariba-k/llm-cultural-alignment-evaluation 获取。
引用
@article{arxiv.2503.08688,
title = {Randomness, Not Representation: The Unreliability of Evaluating Cultural Alignment in LLMs},
author = {Ariba Khan and Stephen Casper and Dylan Hadfield-Menell},
journal= {arXiv preprint arXiv:2503.08688},
year = {2025}
}