中文

遗忘噪声对应关系使CLIP更加鲁棒

计算机视觉与模式识别 2025-07-08 v1 多媒体

摘要

视觉语言模型(VLM)对数据的需求已从早期的数百万持续扩展到如今的数十亿,这面临着与数据质量之间难以维持的权衡,并不可避免地引入了噪声对应(NC)样本。毫无疑问,这种语义无关的数据严重损害了VLM的性能。先前的工作主要通过估计精细对齐以提供更精确的指导来应对这一挑战。然而,这种从头训练VLM的资源密集型流程难以满足现实的数据需求。在本文中,我们提出了一个全新的视角,旨在直接消除预训练VLM中NC的有害影响。具体来说,我们提出了NCU,一个噪声对应遗忘微调框架,通过遗忘已学习的噪声知识来有效增强VLM的鲁棒性。NCU的关键在于学习最难的负信息,这可以为假正例和假负例提供明确的遗忘方向。这种双重目标的遗忘过程可以形式化为一个统一的最优传输目标,以实现快速微调。我们在各种下游任务上使用流行的CLIP模型验证了我们的方法。值得注意的是,NCU在零样本迁移上超越了鲁棒的预训练方法,同时计算开销更低。代码将在接收后发布。

关键词

引用

@article{arxiv.2507.03434,
  title  = {Unlearning the Noisy Correspondence Makes CLIP More Robust},
  author = {Haochen Han and Alex Jinpeng Wang and Peijun Ye and Fangming Liu},
  journal= {arXiv preprint arXiv:2507.03434},
  year   = {2025}
}

备注

ICCV 2025