面向自然语言模型理解的局部聚合特征归因
计算与语言
2022-04-27 v2 人工智能
摘要
随着深度学习模型日益普及,模型理解变得更为重要。为使可解释性更好,已投入大量努力揭密深度神经网络。一些特征归因方法在计算机视觉中展现出有前景的结果,尤其是基于梯度的方法,其中利用参考数据有效平滑梯度是获得鲁棒且忠实结果的关键。然而,由于输入由离散词元组成且“参考”词元未被明确定义,将这些基于梯度的方法直接应用于NLP任务并非易事。本工作中,我们提出局部聚合特征归因(LAFA),一种用于NLP模型的新型基于梯度的特征归因方法。它不依赖模糊的参考词元,而是通过聚合从语言模型嵌入导出的相似参考文本来平滑梯度。为评估,我们还在不同NLP任务上设计了实验,包括公开数据集上的实体识别与情感分析,以及构建的Amazon目录数据集上的关键特征检测。所提方法的优越性能通过实验得以证明。
引用
@article{arxiv.2204.10893,
title = {Locally Aggregated Feature Attribution on Natural Language Model Understanding},
author = {Sheng Zhang and Jin Wang and Haitao Jiang and Rui Song},
journal= {arXiv preprint arXiv:2204.10893},
year = {2022}
}
备注
NAACL 2022