中文

利用显著性图调查去偏与伪影去除之间的关系

机器学习 2025-04-25 v3 人工智能 计算机与社会

摘要

机器学习系统的广泛采用引发了关于公平性和偏见的关键关注,使缓解有害偏见对AI开发至关重要。在本文中,我们调查了去偏与去除神经网络中伪影之间的关系。首先,我们引入了一组基于可解释AI(XAI)的新指标,通过分析显著性图来评估模型决策过程的变化。然后,我们证明了成功的去偏方法系统地将模型注意力从受保护属性上移开。最后,我们表明最初为伪影去除开发的技术可以有效地重新用于提高公平性。这些发现为确保公平性和去除与受保护属性对应的伪影之间存在双向联系提供了证据。

关键词

引用

@article{arxiv.2503.00234,
  title  = {Investigating the Relationship Between Debiasing and Artifact Removal using Saliency Maps},
  author = {Lukasz Sztukiewicz and Ignacy Stępka and Michał Wiliński and Jerzy Stefanowski},
  journal= {arXiv preprint arXiv:2503.00234},
  year   = {2025}
}