中文

鲁棒的不忠性:当基于掩码语言模型的忠实度度量具有误导性时

计算与语言 2024-06-04 v2 机器学习

摘要

量化神经文本分类器可解释性的一种常见方法是基于迭代掩码显著输入词元并测量模型预测的变化来计算忠实度指标。我们提出该性质更宜描述为“对迭代掩码的敏感性”,并强调在使用该度量比较文本分类器可解释性时的陷阱。我们表明,迭代掩码在原本可比较的 Transformer 编码器文本分类器之间产生很大的忠实度分数差异。我们随后证明,迭代掩码样本产生的嵌入位于训练期间所见分布之外,导致不可预测的行为。我们进一步探讨了削弱使用迭代掩码进行可解释性原则性比较的任务特定考量,例如其与基于显著性的对抗攻击的潜在相似性。我们的发现深入揭示了这些行为如何影响神经文本分类器,并为应如何解释对迭代掩码的敏感性提供指导。

关键词

引用

@article{arxiv.2308.06795,
  title  = {Robust Infidelity: When Faithfulness Measures on Masked Language Models Are Misleading},
  author = {Evan Crothers and Herna Viktor and Nathalie Japkowicz},
  journal= {arXiv preprint arXiv:2308.06795},
  year   = {2024}
}