通过语义匹配修正特征归因方法中的确认偏差
机器学习
2024-02-27 v3 人工智能
摘要
特征归因方法已成为剖析黑盒模型复杂行为的主流方法。尽管取得了成功,一些学者认为此类方法存在严重缺陷:它们无法基于人类概念提供可靠的解释。简言之,可视化一组特征贡献不足以让人类得出关于模型内部表示的结论,而确认偏差可能误导用户对模型行为产生错误信念。我们认为,需要一种结构化方法来检验我们关于模型的假设是否得到特征归因的证实。这就是我们所称的人类概念与(亚符号)解释之间的“语义匹配”。基于 Cinà 等人 [2023] 提出的理论框架,我们提出了一种在实践中评估语义匹配的结构化方法。我们在一组涵盖表格数据与图像数据的实验中展示了该流程,并说明语义匹配的评估如何揭示模型的可取行为(例如聚焦于与预测相关的对象)与不可取行为(例如聚焦于虚假相关性)。我们将实验结果与衡量语义匹配的指标分析相结合,并主张该方法构成了解决 XAI 中确认偏差问题的第一步。
引用
@article{arxiv.2307.00897,
title = {Fixing confirmation bias in feature attribution methods via semantic match},
author = {Giovanni Cinà and Daniel Fernandez-Llaneza and Ludovico Deponte and Nishant Mishra and Tabea E. Röber and Sandro Pezzelle and Iacer Calixto and Rob Goedhart and Ş. İlker Birbil},
journal= {arXiv preprint arXiv:2307.00897},
year = {2024}
}