中文

忠实还是捏造?LLM 评判器中理性化偏见的因果框架

计算与语言 2026-05-26 v1

摘要

大型语言模型(LLM)越来越被用作摘要和对话评估的自动评判器。先前的工作已记录了位置、 verbosity 和风格偏好等偏见,但主要关注结果,留下了评判器解释的探讨。我们反问的是,LLM 评判器是否具有因果不变性,即在保持底层文本固定的前提下,对非证据线索进行扰动时,其排序和解释是否保持稳定。我们引入了一套因果干预(Blind、Truth、Flip、Placebo、Reveal-After),并提出了衡量结果锚定和理由锚定的指标,包括标签对齐的修辞和解释漂移、一致性和刻板印象注入检查。我们设计了基于 verbosity 和置信度线索的锚定攻击,并比较了两种缓解措施:结构化链式思维提示和 PROOF-BEFORE-PREFERENCE(证据锁定、评分、排序)。使用来自传统提取模型和 LLM 的 1,000 条摘要构建的新数据集,我们发现标签和 placebo 扰动下存在显著的因果锚定理性化,而 PROOF-BEFORE-PREFERENCE显著优于基线方法在因果不变性方面。

关键词

引用

@article{arxiv.2605.23970,
  title  = {Faithful or Fabricated? A Causal Framework for Rationalization Bias in LLM Judges},
  author = {Riya Tapwal and Abhishek Kumar and Carsten Maple},
  journal= {arXiv preprint arXiv:2605.23970},
  year   = {2026}
}