可度量忠实性的掩码语言模型
计算与语言
2024-08-29 v3 机器学习
摘要
解释 NLP 模型的常见方法是使用重要性度量来表达哪些词元对预测重要。遗憾的是,此类解释尽管具有说服力却常常是错误的。因此,度量其忠实性至关重要。这样一种度量是:若词元确实重要,则掩码它们应导致更差的模型性能。然而,词元掩码会引入分布外问题,而解决此问题的现有方案计算昂贵且采用代理模型。此外,其他度量在适用范围上非常有限。本工作提出一种天然可度量忠实性的模型以应对这些挑战。这是通过一种融合掩码的新型微调方法实现的,使得掩码词元在设计上变为分布内。这与现有完全模型无关但在实践中不适用的方法不同。我们通过对 16 个不同数据集应用该方法证明了其通用性,并使用统计分布内检验加以验证。随后用 9 种不同重要性度量对忠实性进行度量。由于掩码是分布内的,本身使用掩码的重要性度量变得持续更具忠实性。另外,由于该模型使忠实性度量成本低廉,我们可将解释优化至最大忠实性;因此,我们的模型间接成为天然可解释的。
引用
@article{arxiv.2310.07819,
title = {Faithfulness Measurable Masked Language Models},
author = {Andreas Madsen and Siva Reddy and Sarath Chandar},
journal= {arXiv preprint arXiv:2310.07819},
year = {2024}
}