中文

大语言模型忠实自解释的训练与泛化研究

计算与语言 2025-12-09 v1

摘要

大语言模型有潜力根据用户指令以多种风格生成对其自身预测的解释。近期研究考察了这些自解释是否忠实反映了模型的实际行为,并发现它们往往缺乏忠实性。然而,如何提高忠实性的问题仍未被充分探索。此外,由于不同解释风格在表面上具有明显不同的特征,尚不清楚在一种风格中观察到的改进在使用其他风格时是否也会出现。本研究分析了忠实自解释训练的效果以及这些效果泛化的程度,使用了三个分类任务和三种解释风格。我们使用特征归因方法构建了可能忠实的一词约束解释,并将这些伪忠实自解释用于指令微调模型的持续学习。实验表明,训练可以提高所有分类任务和解释风格中的自解释忠实性,并且这些改进也显示出向多词设置和未见任务泛化的迹象。此外,我们在三种风格之间发现了一致的跨风格泛化,表明训练可能有助于更广泛地提升忠实自解释能力。

关键词

引用

@article{arxiv.2512.07288,
  title  = {Investigating Training and Generalization in Faithful Self-Explanations of Large Language Models},
  author = {Tomoki Doi and Masaru Isonuma and Hitomi Yanaka},
  journal= {arXiv preprint arXiv:2512.07288},
  year   = {2025}
}

备注

To appear in the Proceedings of the Asia-Pacific Chapter of the Association for Computational Linguistics: Student Research Workshop (AACL-SRW 2025)