中文

面向自然语言模型理解的局部聚合特征归因

计算与语言 2022-04-27 v2 人工智能

摘要

随着深度学习模型日益普及,模型理解变得更为重要。为使可解释性更好,已投入大量努力揭密深度神经网络。一些特征归因方法在计算机视觉中展现出有前景的结果,尤其是基于梯度的方法,其中利用参考数据有效平滑梯度是获得鲁棒且忠实结果的关键。然而,由于输入由离散词元组成且“参考”词元未被明确定义,将这些基于梯度的方法直接应用于NLP任务并非易事。本工作中,我们提出局部聚合特征归因(LAFA),一种用于NLP模型的新型基于梯度的特征归因方法。它不依赖模糊的参考词元,而是通过聚合从语言模型嵌入导出的相似参考文本来平滑梯度。为评估,我们还在不同NLP任务上设计了实验,包括公开数据集上的实体识别与情感分析,以及构建的Amazon目录数据集上的关键特征检测。所提方法的优越性能通过实验得以证明。

关键词

引用

@article{arxiv.2204.10893,
  title  = {Locally Aggregated Feature Attribution on Natural Language Model Understanding},
  author = {Sheng Zhang and Jin Wang and Haitao Jiang and Rui Song},
  journal= {arXiv preprint arXiv:2204.10893},
  year   = {2022}
}

备注

NAACL 2022