TTD:文本-标签自蒸馏增强 CLIP 中的图文对齐以缓解单标签偏差
计算机视觉与模式识别
2024-05-22 v2
摘要
我们识别出当代基于 CLIP 的模型中存在的一种关键偏差,我们将其称为单标签偏差。这种偏差表现为过度关注单个标签(词)而忽略其他相关标签,这源于 CLIP 的文本嵌入在图文关系中优先考虑某一个特定标签。当将文本解构为单个标签时,往往只有一个标签与 CLIP 的图像嵌入具有高相关性,从而导致有偏的标签相关性。在本文中,我们引入了一种新颖的两步微调方法,即文本-标签自蒸馏 (TTD),以应对这一挑战。TTD 首先根据文本与最近像素的相似度从文本中提取与图像相关的标签,然后采用自蒸馏策略将组合掩码与文本衍生的掩码对齐。这种方法仅使用图文对即可确保基于 CLIP 的模型进行无偏的图文对齐,而无需额外的监督。我们的技术在多标签分类和分割任务中展示了与模型无关的改进,超越了依赖外部资源的竞争方法。代码可在 https://github.com/shjo-april/TTD 获取。
引用
@article{arxiv.2404.00384,
title = {TTD: Text-Tag Self-Distillation Enhancing Image-Text Alignment in CLIP to Alleviate Single Tag Bias},
author = {Sanghyun Jo and Soohyun Ryu and Sungyub Kim and Eunho Yang and Kyungsu Kim},
journal= {arXiv preprint arXiv:2404.00384},
year = {2024}
}