中文

当措辞左右评估:LLM 评判中的框架偏差

计算与语言 2026-01-21 v1 人工智能

摘要

已知大型语言模型(LLM)会根据提示措辞产生不同响应,这表明措辞中的微妙引导可以左右其答案。然而,在基于 LLM 的评估中,这种框架偏差对模型做出稳定公正判断能力的影响在很大程度上尚未被探索,而评估正要求模型做出稳定公正的判断。受心理学中框架效应的启发,我们系统地研究了在四个高风险评估任务中,刻意的提示框架如何导致模型判断产生偏差。我们使用谓词肯定和谓词否定结构设计对称提示,并证明这种框架会在模型输出中引发显著差异。在 14 个 LLM 评判器中,我们观察到对框架的明显易感性,不同模型家族在同意或拒绝上表现出截然不同的倾向。这些发现表明,框架偏差是当前基于 LLM 的评估系统的结构性属性,凸显了需要具备框架感知的协议。

关键词

引用

@article{arxiv.2601.13537,
  title  = {When Wording Steers the Evaluation: Framing Bias in LLM judges},
  author = {Yerin Hwang and Dongryeol Lee and Taegwan Kang and Minwoo Lee and Kyomin Jung},
  journal= {arXiv preprint arXiv:2601.13537},
  year   = {2026}
}

备注

4 pages