论信念偏差与解释的交互作用
计算与语言
2021-06-30 v1 人机交互
摘要
近年来提出了大量可解释性方法,但对于如何评估它们却鲜有共识。虽然自动指标便于快速基准测试,但此类指标如何反映人与解释的交互尚不清楚。人类评估至关重要,但此前的协议未能考虑影响人类表现的信念偏差,这可能导致误导性结论。我们概述了信念偏差、其在人类评估中的作用,以及 NLP 从业者应如何考量它的思路。针对两种实验范式,我们呈现了一个基于梯度的可解释性案例研究,引入简单方法来考量人的先验信念:不同质量的模型与对抗样本。我们表明,在引入此类控制后,关于表现最佳方法的结论会发生改变,这指向在评估中考量信念偏差的重要性。
引用
@article{arxiv.2106.15355,
title = {On the Interaction of Belief Bias and Explanations},
author = {Ana Valeria Gonzalez and Anna Rogers and Anders Søgaard},
journal= {arXiv preprint arXiv:2106.15355},
year = {2021}
}
备注
accepted at findings of ACL 2021