中文

偏差增强一致性训练减少思维链中的偏差推理

计算与语言 2025-06-30 v3 人工智能

摘要

思维链提示(CoT)有潜力提高语言模型推理的可解释性。但 CoT 也可能系统性地歪曲影响模型行为的因素——例如,按照用户的观点合理化答案。我们首先创建了一个包含 9 种不同偏差的新数据集,这些偏差影响 GPT-3.5-Turbo 和 Llama-8b 模型。这些偏差包括虚假少样本模式、事后合理化和阿谀奉承设置。模型会切换到偏差所暗示的答案,而不在 CoT 中提及偏差的影响。为了缓解这一偏差推理问题,我们引入了偏差增强一致性训练(BCT),这是一种无监督微调方案,旨在训练模型在带有和不带偏差特征的提示下给出一致的推理。我们构建了一套测试套件,在七个问答任务上测试九种形式的偏差推理,发现将 BCT 应用于 GPT-3.5-Turbo 并针对一种偏差进行训练,可使保留任务上的偏差推理率降低 86%。此外,该模型能泛化到其他形式的偏差,将保留偏差上的偏差推理平均降低了 37%。由于 BCT 能泛化到保留偏差且不需要黄金标签,该方法在减少未知偏差引起的推理偏差以及在缺乏真实推理基础的任务中可能具有前景。

关键词

引用

@article{arxiv.2403.05518,
  title  = {Bias-Augmented Consistency Training Reduces Biased Reasoning in Chain-of-Thought},
  author = {James Chua and Edward Rees and Hunar Batra and Samuel R. Bowman and Julian Michael and Ethan Perez and Miles Turpin},
  journal= {arXiv preprint arXiv:2403.05518},
  year   = {2025}
}