中文

诊断和缓解LLM因果判断中的迎合与怀疑

人工智能 2026-04-09 v3

摘要

大型语言模型(LLM)越来越容易以标量准确率无法诊断的方式失败:它们会产生正确的推理轨迹,然后在社会压力或权威提示下放弃该推理。我们认为这属于控制失败而非知识失败,需要比单个准确率数字更丰富的评估表面。我们引入CAUSALT3,这是一个由专家精选的454个实例基准测试,覆盖珍珠梯阶的三个层次,以及一种三轴评估方法,将性能分解为Utility(对有效因果声明的灵敏度)、Safety(对无效声明的特异性)和Wise Refusal(对真正不确定项目的校准回避)。在该评估表面上,我们记录了三个可复现的病态:在L1处出现Skepticism Trap(L1陷阱),即能力较强的模型过度回避正确的链接;在L2处出现Sycophancy Trap(迎合陷阱),即在用户压力下正确答案被翻转;在L3处出现Scaling Paradox(规模悖论),即前沿模型在反事实安全性上跌居旧模型之后55分。为在不重新训练的情况下缓解这些失败,我们提出了Regulated Causal Anchoring(RCA)方法,一种类似PID反馈环的推理时间过程验证器,用于审计轨迹输出在反馈下的一致性,并在检测到不匹配时选择回避而非确认。在CAUSALT3和支持性CAP-GSM8K压力测试上,RCA将迎合式接受降至接近零,同时保留有效提示的接受,将可信推理重新定义为推理时间控制问题而非规模问题。

关键词

引用

@article{arxiv.2601.08258,
  title  = {Diagnosing and Mitigating Sycophancy and Skepticism in LLM Causal Judgment},
  author = {Edward Y. Chang},
  journal= {arXiv preprint arXiv:2601.08258},
  year   = {2026}
}

备注

19 pages, 3 figures, 15 tables