基于注意力机制的解释的正则化、半监督与监督
计算与语言
2025-01-23 v1
摘要
注意力机制是近期自然语言处理机器学习进步的主要贡献者。此外,它产生注意力图,显示每个输入在决策中所占的比例影响。经验研究认为,注意力图可作为模型输出的解释。然而,是否这样的解释有助于普通用户理解和接受模型输出(即解释的可信度)仍存疑问。近期研究表明,RNN编码器中的注意力权重难以具有可信度,因为它们在输入标记上扩散。因此,我们提出了三项额外约束添加到学习目标函数中,以提高注意力图的可信度:正则化以增加注意力权重稀疏性、半监督以启发式方法监督注意力图、以及通过人工标注进行监督。结果表明,所有技术在一定程度上都能提高注意力图的可信度。我们还观察到,针对人工标注的特定指令可能对分类性能产生负面影响。除了注意力图之外,文本分类任务的实验结果也表明,无论约束带来多少收益,上下文层在寻找合适空间以寻找可信标记方面起着关键作用。
引用
@article{arxiv.2501.12775,
title = {Regularization, Semi-supervision, and Supervision for a Plausible Attention-Based Explanation},
author = {Duc Hau Nguyen and Cyrielle Mallart and Guillaume Gravier and Pascale Sébillot},
journal= {arXiv preprint arXiv:2501.12775},
year = {2025}
}