TLDR:基于文本的最后一层重训练以去偏图像分类器
计算机视觉与模式识别
2024-12-10 v2
摘要
图像分类器可能依赖于训练数据集中特征与分类目标强相关所产生的附带特征。近来,使用组平衡数据集的最后一层重训练(LLR)被证明能高效缓解分类器的伪相关。然而,基于图像的平衡组数据集的获取成本高昂,这阻碍了 LLR 方法的普遍适用性。本工作中,我们提出基于用大语言模型构建的文本数据集来执行 LLR,以对通用图像分类器去偏。为此,我们证明文本通常可超越图文联合嵌入空间作为其对应图像的代理,这是通过一个确保其权重与联合嵌入空间的模态间隙正交的线性投影器实现的。此外,我们提出了一种系统性验证流程,用于检查生成的词语是否与 CLIP 的嵌入空间及图像分类器兼容,该流程被证明能有效提升去偏性能。我们将这些流程命名为 TLDR(基于文本的最后一层重训练以去偏图像分类器),并展示我们的方法取得了与需要组平衡图像数据集进行重训练的 LLR 方法相竞争的性能。此外,TLDR 优于其他涉及在无任何组标注数据集情况下训练最后一层的基线。代码:https://github.com/beotborry/TLDR
引用
@article{arxiv.2311.18291,
title = {TLDR: Text Based Last-layer Retraining for Debiasing Image Classifiers},
author = {Juhyeon Park and Seokhyeon Jeong and Taesup Moon},
journal= {arXiv preprint arXiv:2311.18291},
year = {2024}
}
备注
WACV 2025