中文

评估 LLM 行为倾向的对齐性

计算与语言 2026-02-13 v1

摘要

随着 LLM 融入我们的日常生活,理解其行为变得至关重要。本文聚焦于行为倾向——塑造社交情境下响应的底层趋势——并引入一种框架来研究 LLM 表达的倾向与人类的对齐程度。我们的做法基于 established psychological questionnaires,但为 LLM 调整了这些问卷,通过将人类自我报告语句转化为情境判断测试(SJT)。这些 SJT 通过引发真实用户-助理情境下的自然推荐来评估行为。我们生成了 2,500 个 SJT,由三位人类注释员验证,并从 550 名大型池子中收集每个 SJT 来自 10 位注释员的偏好动作。在涉及 25 个 LLM 的全面研究中,我们发现模型往往不反映人类偏好的分布:(1)在人类共识较低的情境中,LLM 持续表现出对单一响应的过度自信;(2)当人类共识较高时,较小的模型显著偏离,即使某些前沿模型在 15-20% 的情况下也不反映共识;(3)某些特征可以在 LLM 之间呈现出跨 LLM 模式,例如 LLM 可能在人类共识倾向于保持克制的情境中鼓励情感表达。最后,将心理测量语句直接映射到行为情境为评估自我报告的预测有效性提供了独特机会,揭示了 LLM 声明价值与其揭示的行为之间存在相当大的差距。

关键词

引用

@article{arxiv.2602.11328,
  title  = {Evaluating Alignment of Behavioral Dispositions in LLMs},
  author = {Amir Taubenfeld and Zorik Gekhman and Lior Nezry and Omri Feldman and Natalie Harris and Shashir Reddy and Romina Stella and Ariel Goldstein and Marian Croak and Yossi Matias and Amir Feder},
  journal= {arXiv preprint arXiv:2602.11328},
  year   = {2026}
}