中文

仅使用文本训练对视觉语言模型进行去偏

计算机视觉与模式识别 2024-10-15 v1 机器学习

摘要

预训练的视觉语言模型 (VLMs),如 CLIP,通过在统一的嵌入空间中对齐文本和图像,在各种下游任务中表现出色。然而,由于预训练数据集分布不平衡,CLIP 在实际应用中存在偏差问题。现有的去偏方法难以获得足够数量的少数群体图像样本,并且群体标注成本高昂。为解决这些局限性,我们提出了一种名为 TOD 的仅文本去偏框架,利用文本即图像训练范式来减轻视觉偏差。具体来说,该方法重新利用文本编码器来充当图像编码器,从而消除了对图像数据的需求。同时,它利用大型语言模型 (LLM) 生成平衡的文本数据集,然后用于提示调优。然而,我们观察到模型会过拟合文本模态,因为作为监督信号的标签名称显式地出现在文本中。为解决此问题,我们进一步引入了多目标预测 (MTP) 任务,促使模型关注复杂上下文并区分目标信息和偏差信息。在 Waterbirds 和 CelebA 数据集上的大量实验表明,我们的方法显著提高了群体鲁棒性,在无图像方法中取得了最先进的结果,甚至与有图像监督的方法相比也表现出有竞争力的性能。此外,所提出的方法可以适应具有多个或未知偏差属性的挑战性场景,展示了其强大的泛化能力和鲁棒性。

关键词

引用

@article{arxiv.2410.09365,
  title  = {Debiasing Vison-Language Models with Text-Only Training},
  author = {Yunfan Yang and Chaoquan Jiang and Zhiyu Lin and Jinlin Xiao and Jiaming Zhang and Jitao Sang},
  journal= {arXiv preprint arXiv:2410.09365},
  year   = {2024}
}