中文

重新审视大语言模型价值观探测策略:它们鲁棒且具有表现力吗?

计算与语言 2025-07-21 v1

摘要

评估大语言模型(LLM)的价值取向已有广泛研究,因为这可能影响不同人口群体用户的体验。然而,仍存在若干挑战。首先,虽然多项选择题(MCQ)设置已被证明易受扰动影响,但尚无对价值观探测方法的系统性比较。其次,探测到的价值观在多大程度上捕捉了上下文信息并反映了模型对现实世界行动的偏好尚不清楚。本文评估了三种广泛使用的探测策略下价值观表征的鲁棒性和表现力。我们通过改变提示和选项,表明所有方法在输入扰动下均表现出较大方差。我们还引入了两项任务,研究价值观是否对人口统计背景敏感,以及它们与模型在价值观相关场景中行为的对齐程度。我们表明,人口统计背景对自由文本生成影响甚微,且模型的价值观与其对基于价值观的行动的偏好仅弱相关。我们的工作强调需要更仔细地审视大语言模型价值观探测并认识其局限性。

关键词

引用

@article{arxiv.2507.13490,
  title  = {Revisiting LLM Value Probing Strategies: Are They Robust and Expressive?},
  author = {Siqi Shen and Mehar Singh and Lajanugen Logeswaran and Moontae Lee and Honglak Lee and Rada Mihalcea},
  journal= {arXiv preprint arXiv:2507.13490},
  year   = {2025}
}