中文

你的模型不公平,你意识到了吗?偏见机器学习模型可解释性可视化中理解与信任的反向关系

人机交互 2025-08-04 v1 人工智能

摘要

依赖机器学习 (ML) 的系统已变得无处不在,但其中的偏见行为也同样普遍。研究表明,偏见会显著影响利益相关者对系统的信任及其使用方式。此外,不同背景的利益相关者对相同系统的看法和信任度也有所不同。因此,ML 模型行为的解释方式在理解和信任方面起着关键作用。我们调研了可解释性可视化方法,创建了设计特征的分类体系。我们进行了用户研究,以评估五种最先进的模型可解释性可视化工具 (LIME、SHAP、CP、Anchors 和 ELI5),测量了分类体系特征如何影响非专家 ML 用户的理解、偏见感知和信任。令人惊讶的是,我们发现了理解与信任之间的反向关系:用户对模型理解得越好,他们就越不信任模型。我们调查了其原因,发现这种关系受偏见感知的强烈中介作用:更易理解的可视化增加了人们对偏见的感知,而偏见感知的增加降低了信任。我们证实了这种因果关系:通过操纵可解释性可视化来控制理解、偏见感知和信任,我们表明可视化设计可以显著 (p < 0.001) 增加理解、增加感知到的偏见并降低信任。相反,通过提高模型公平性或调整可视化设计来降低感知到的模型偏见,即使在理解保持较高水平时,也能显著增加信任。我们的工作推进了对理解如何影响信任的认识,并系统地调查了可视化在促进负责任 ML 应用中的作用。

关键词

引用

@article{arxiv.2508.00140,
  title  = {Your Model Is Unfair, Are You Even Aware? Inverse Relationship Between Comprehension and Trust in Explainability Visualizations of Biased ML Models},
  author = {Zhanna Kaufman and Madeline Endres and Cindy Xiong Bearfield and Yuriy Brun},
  journal= {arXiv preprint arXiv:2508.00140},
  year   = {2025}
}