中文

通过反事实推理理解与评估计算机视觉模型

计算机视觉与模式识别 2025-08-29 v1

摘要

反事实推理——通过变更输入并观察模型行为变化以提出“如果”情境——已成为可解释且公平的人工智能核心。本论文发展框架利用反事实方法来解释、审计和缓解视觉分类器和生成模型中的偏见。通过在保持其他属性不变的前提下系统性地改变语义上有意义的属性,这些方法揭示了潜在的相关性、探索因果依赖关系,并帮助构建更稳健的系统。第一部分针对视觉分类器。CAVLI将归因(LIME)与概念级分析(TCAV)集成,量化决策对人类可解释概念的依赖程度。通过局部热力图和概念依赖得分,CAVLI显示模型何时依赖于背景等无关线索。扩展而来,ASAC引入对抗性反事实,扰动受保护属性但保持语义一致。通过课程学习,ASAC在避免刻板印象的前提下,对偏见模型进行微调,以实现更好的公平性和准确性。第二部分针对生成式文本到图像(TTI)模型。TIBET提供了可扩展的管道,通过变更与身份相关的术语来评估提示敏感性偏见,实现对种族、性别和年龄对图像生成影响的因果审计。为捕捉交互作用,BiasConnect构建因果图,诊断交叉性偏见。最后,InterMit提供一种模块化、无需训练的算法,通过因果灵敏度得分和用户定义的公平性目标缓解交叉性偏见。这些贡献表明,反事实推理作为解释、公平性和因果性在判别模型和生成模型中的统一视角,建立了原则且可扩展的方法,用于社会负责任的偏见评估和缓解。

关键词

引用

@article{arxiv.2508.20881,
  title  = {Understanding and evaluating computer vision models through the lens of counterfactuals},
  author = {Pushkar Shukla},
  journal= {arXiv preprint arXiv:2508.20881},
  year   = {2025}
}