解释、编辑与理解:重新思考用于评估模型解释的用户研究设计
计算与语言
2022-08-23 v2
摘要
在试图“解释”机器学习模型预测的尝试中,研究者已提出数百种将预测归因于被认为重要的特征的技术。虽然这些归因常被声称有潜力改善人类对该模型的“理解”,但令人惊讶的是,极少有工作显式评估朝向这一愿景的进展。在本文中,我们进行了一项众包研究,参与者与经过训练以区分真实与虚假酒店评论的欺骗检测模型交互。他们既被要求在新鲜评论上模拟该模型,也被要求以 lowering 原始预测类别的概率为目标编辑评论。成功的操控将产生对抗样本。在训练(而非测试)阶段,输入片段被高亮以传达显著性。通过我们的评估,我们观察到:对于线性词袋模型,与无解释对照组相比,训练期间可访问特征系数的参与者在测试阶段能够引起模型置信度更大幅度的降低。对于基于BERT的分类器,流行的局部解释并未比无解释情况改善其降低模型置信度的能力。值得注意的是,当BERT模型的解释由训练来模仿BERT模型的线性模型的(全局)归因给出时,人们能够有效操控该模型。
引用
@article{arxiv.2112.09669,
title = {Explain, Edit, and Understand: Rethinking User Study Design for Evaluating Model Explanations},
author = {Siddhant Arora and Danish Pruthi and Norman Sadeh and William W. Cohen and Zachary C. Lipton and Graham Neubig},
journal= {arXiv preprint arXiv:2112.09669},
year = {2022}
}
备注
AAAI 2022