中文

CLASH:基于角色视角评估高风险困境中的语言模型

计算与语言 2025-09-29 v3 人工智能

摘要

在涉及冲突价值的高风险领域中,人类面临的困境对 AI 也充满挑战,而现有工作仅限于日常场景。为弥合这一差距,我们提出了 CLASH (Character perspective-based LLM Assessments in Situations with High-stakes),一个精心策划的数据集,包含 345 个高影响力的困境以及 3,795 个不同价值观的个人视角。CLASH 使我们能够研究价值基于决策过程的关键且尚未被充分探索的方面,包括决策模糊性和心理不适,以及捕捉角色视角中价值的时间变化。通过对 14 个非思考型和思考型模型进行基准测试,我们发现了若干关键发现。(1) 即使是强大的专有模型,如 GPT-5 和 Claude-4-Sonnet,在处理模糊决策方面也仅能实现 24.06% 和 51.01% 的准确率。(2) 虽然 LLMs 对心理不适的预测较为合理,但对价值观变化的视角理解不足。(3) 在数学解答和游戏策略领域有效的认知行为并不 transfer 到价值推理中,取而代之的是新的失败模式,包括早期承诺和过度承诺。(4) LLMs 对于给定价值的可驾驭性与其价值偏好显著相关。(5) 最后,LLMs 在从第三方视角推理时表现出更大的可驾驭性,尽管某些价值观(如安全性)独特受益于第一人称框架。

关键词

引用

@article{arxiv.2504.10823,
  title  = {CLASH: Evaluating Language Models on Judging High-Stakes Dilemmas from Multiple Perspectives},
  author = {Ayoung Lee and Ryan Sungmo Kwon and Peter Railton and Lu Wang},
  journal= {arXiv preprint arXiv:2504.10823},
  year   = {2025}
}