对齐大语言模型的所言与所行:迈向自洽解释
计算与语言
2026-04-14 v3
摘要
大语言模型(LLM)似乎提供了一条通往可解释性的捷径:只需让它们解释自己的答案即可。然而,驱动答案的特征往往与其解释中强调的特征不同,这意味着事后解释可能歪曲了实际塑造模型输出的因素。我们通过比较答案及其解释的特征重要性分布来量化这一差距。先前的分析揭示了这种差异,但大规模研究一直受限于归因方法的高计算成本。为解决此问题,我们引入了事后自洽性库(PSCB),这是一个大规模基准,将模型决策与跨数据集、方法和模型家族的多样化解释及归因向量联系起来。利用PSCB,我们发现斯皮尔曼秩相关系数比余弦相似度提供了更可靠的对齐信号。基于这一见解,我们将直接偏好优化(DPO)应用于基于归因的偏好数据,在不降低任务准确率的情况下改善了对齐,并表明在相同数据上进行标准监督微调无法获得类似的增益。这些改进在不同领域具有鲁棒的泛化能力,为LLM决策与其自然语言解释之间实现可扩展且忠实的对齐铺平了道路。
引用
@article{arxiv.2506.07523,
title = {Aligning What LLMs Do and Say: Towards Self-Consistent Explanations},
author = {Sahar Admoni and Ofra Amir and Assaf Hallak and Yftah Ziser},
journal= {arXiv preprint arXiv:2506.07523},
year = {2026}
}
备注
Accepted to Findings of ACL 2026