忠实还是捏造?LLM 评判器中理性化偏见的因果框架
计算与语言
2026-05-26 v1
摘要
大型语言模型(LLM)越来越被用作摘要和对话评估的自动评判器。先前的工作已记录了位置、 verbosity 和风格偏好等偏见,但主要关注结果,留下了评判器解释的探讨。我们反问的是,LLM 评判器是否具有因果不变性,即在保持底层文本固定的前提下,对非证据线索进行扰动时,其排序和解释是否保持稳定。我们引入了一套因果干预(Blind、Truth、Flip、Placebo、Reveal-After),并提出了衡量结果锚定和理由锚定的指标,包括标签对齐的修辞和解释漂移、一致性和刻板印象注入检查。我们设计了基于 verbosity 和置信度线索的锚定攻击,并比较了两种缓解措施:结构化链式思维提示和 PROOF-BEFORE-PREFERENCE(证据锁定、评分、排序)。使用来自传统提取模型和 LLM 的 1,000 条摘要构建的新数据集,我们发现标签和 placebo 扰动下存在显著的因果锚定理性化,而 PROOF-BEFORE-PREFERENCE显著优于基线方法在因果不变性方面。
引用
@article{arxiv.2605.23970,
title = {Faithful or Fabricated? A Causal Framework for Rationalization Bias in LLM Judges},
author = {Riya Tapwal and Abhishek Kumar and Carsten Maple},
journal= {arXiv preprint arXiv:2605.23970},
year = {2026}
}