中文

人类关于模型行为的解释在多大程度上与实际模型行为一致?

计算与语言 2021-09-20 v2

摘要

鉴于 NLP 模型(将)在我们生活中扮演日益突出的角色,使人类对于模型行为的预期与实际模型行为相一致十分重要。以自然语言推理(NLI)为案例,我们考察人类生成的模型推理决策解释在多大程度上与模型实际做出这些决策的方式一致。更具体地,我们定义了三个对齐度量,量化自然语言解释与模型对输入词的敏感性(由积分梯度度量)的一致程度。随后,我们评估了八种不同的模型(BERT、RoBERTa 和 ELECTRA 的 base 与 large 版本,以及一个 RNN 和词袋模型),发现对于所有对齐度量,BERT-base 模型与人类生成的解释具有最高的一致性。聚焦于 transformer,我们发现 base 版本往往比其更大的对应版本具有更高的人类解释一致性,表明在某些情况下增加模型参数量会导致更差的解释一致性。最后,我们发现模型与人类解释的一致性不能由模型准确率预测,表明准确率与一致性是评估模型的互补方式。

关键词

引用

@article{arxiv.2012.13354,
  title  = {To what extent do human explanations of model behavior align with actual model behavior?},
  author = {Grusha Prasad and Yixin Nie and Mohit Bansal and Robin Jia and Douwe Kiela and Adina Williams},
  journal= {arXiv preprint arXiv:2012.13354},
  year   = {2021}
}

备注

To appear in the Proceedings of BlackBox NLP 2021