中文

通过去偏自注意力实现公平感知的视觉Transformer

计算机视觉与模式识别 2024-07-12 v3 人工智能 机器学习

摘要

Vision Transformer (ViT) 近期因能通过注意力机制提取信息性特征并建模长程依赖,在解决计算机视觉(CV)问题中获得了显著关注。尽管近期工作已探索了 ViT 的可信性,包括其鲁棒性和可解释性,但公平性问题尚未得到充分解决。我们确定,为 CNN 设计的现有公平感知算法在 ViT 上表现不佳,这凸显了通过去偏自注意力(DSA)开发我们新框架的必要性。DSA 是一种通过盲化实现公平的方法,它强制 ViT 消除与敏感标签相关的伪特征以缓解偏差,同时保留真实特征用于目标预测。值得注意的是,DSA 利用对抗样本来定位并掩蔽输入图像块中的伪特征,并在训练目标中加入额外的注意力权重对齐正则化器以鼓励学习真实特征用于目标预测。重要的是,我们的 DSA 框架在多个预测任务上相比先前工作提供了改进的公平性保证,且不损害目标预测性能。代码见 \href{https://github.com/qiangyao1988/DSA}{https://github.com/qiangyao1988/DSA}。

关键词

引用

@article{arxiv.2301.13803,
  title  = {Fairness-aware Vision Transformer via Debiased Self-Attention},
  author = {Yao Qiang and Chengyin Li and Prashant Khanduri and Dongxiao Zhu},
  journal= {arXiv preprint arXiv:2301.13803},
  year   = {2024}
}