中文

通过众包评估NLP中的显著性解释

人机交互 2024-05-20 v1 人工智能

摘要

深度学习模型在诸多NLP任务上表现优异,但其内部机制通常难以被人类理解。因此,发展解释模型的方法已成为关键问题,关乎深度学习模型在许多重要应用中的可靠性。已提出各种显著性解释方法,为每个输入特征赋予与输出贡献成正比的分数,以确定模型最重视输入的哪一部分。尽管已有大量工作针对显著性方法进行评估,但是否存在评估指标结果与人类认知一致的问题仍是开放的。在本研究中,我们提出了一种基于众包的人类方法来评估NLP中的显著性方法。我们招募了800名众包工作者,并在两个数据集上对7种显著性方法进行了实证评估。我们分析了显著性方法的性能,比较了我们的结果与现有自动化评估方法的差异,并在使用显著性方法时识别了NLP与计算机视觉(CV)领域之间的显著差异。我们的众包实验的实例级数据以及可复现解释的源码均已公开于https://github.com/xtlu/lreccoling_evaluation。

关键词

引用

@article{arxiv.2405.10767,
  title  = {Evaluating Saliency Explanations in NLP by Crowdsourcing},
  author = {Xiaotian Lu and Jiyi Li and Zhen Wan and Xiaofeng Lin and Koh Takeuchi and Hisashi Kashima},
  journal= {arXiv preprint arXiv:2405.10767},
  year   = {2024}
}

备注

13 pages, 4 figures, Accepted for LREC-Coling 2024 (Oral)