一种面向孪生编码器的归因方法
计算与语言
2023-11-30 v3 人工智能
机器学习
摘要
尽管孪生编码器模型(如句子Transformer(ST))取得了成功,人们对其所关注的输入方面知之甚少。一个障碍是它们的预测无法归因于单个特征,因为它们比较的是两个输入而非处理单个输入。本文将集成梯度原理推广到多输入模型,推导出孪生编码器的局部归因方法。该解以特征对归因的形式呈现,并可归约为ST的token-token矩阵。我们的方法引入了集成Jacobian,并继承了集成梯度的优良形式性质:它考虑模型的完整计算图且保证收敛于实际预测。初步研究表明,在ST中少数token对常能解释预测的大部分,且其聚焦于名词与动词。但对于准确预测,它仍需关注多数token与词性。
引用
@article{arxiv.2310.05703,
title = {An Attribution Method for Siamese Encoders},
author = {Lucas Möller and Dmitry Nikolaev and Sebastian Padó},
journal= {arXiv preprint arXiv:2310.05703},
year = {2023}
}
备注
Accepted to EMNLP'23