中文

B-cos LM:用于提高可解释性的预训练语言模型转换

计算与语言 2025-12-10 v4 人工智能

摘要

后续黑箱模型的解释方法往往因当前神经网络架构缺乏可解释性而在忠实性和人类可解释性方面受到限制。与此同时,B-cos网络通过去除偏置项并促进输入-权重对齐来提高模型可解释性。虽然B-cos网络在构建可解释系统方面取得了成功,但其应用仅限于计算机视觉模型及其相关训练流程。本文介绍B-cos LM,即用于自然语言处理(NLP)任务的B-cos语言模型(LMs)。我们的方法直接将预训练语言模型转换为B-cos LM,通过结合B-cos转换和任务微调来实现,相较于先前方法具有更高的效率。自动评估和人类评估结果表明,B-cos LM产生的解释更加忠实且更易于人类理解,而在保持与常规微调相当的任务性能方面也表现出色。我们深入分析了B-cos LM与常规微调模型在学习过程和解释模式上的差异。最后,我们首次探索了将解码器模型转换为B-cos LM以适用于生成任务的可能性。我们的代码已公开:https://github.com/Ewanwong/bcos_lm。

关键词

引用

@article{arxiv.2502.12992,
  title  = {B-cos LM: Efficiently Transforming Pre-trained Language Models for Improved Explainability},
  author = {Yifan Wang and Sukrut Rao and Ji-Ung Lee and Mayank Jobanputra and Vera Demberg},
  journal= {arXiv preprint arXiv:2502.12992},
  year   = {2025}
}

备注

TMLR 12/2025