COSMOS:面向视觉语言预训练的跨模态自蒸馏
计算机视觉与模式识别
2025-03-27 v2 人工智能
计算与语言
机器学习
摘要
受对比度损失训练的视觉-语言模型 (VLM) 在各种视觉和语言任务中取得了显著进展。然而,due to the global nature of the contrastive loss, VLMs 主要关注图像中前景对象,忽略了图像中其他关键信息,这限制了其在下游任务中的效果。为此,我们提出了 COSMOS:CrOSs-MOdality Self-distillation for vision-language pre-training,将一种新颖的文本裁剪策略和跨注意力模块集成到自监督学习框架中。我们创建了图像和文本的 global 和 local 视图(即多模态增强),这对于 VLMs 的自蒸馏至关重要。我们进一步引入了跨注意力模块,使 COSMOS 能够学习优化于跨模态自蒸馏损失下的综合跨模态表示。COSMOS 在各种 zero-shot 下游任务中 consistently 优于以往强大基准,包括检索、分类和语义分割。此外,它在视觉感知和情境理解任务中超过了在更大数据集上训练的 CLIP-based 模型。代码可在 https://github.com/ExplainableML/cosmos 获取。
引用
@article{arxiv.2412.01814,
title = {COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training},
author = {Sanghwan Kim and Rui Xiao and Mariana-Iuliana Georgescu and Stephan Alaniz and Zeynep Akata},
journal= {arXiv preprint arXiv:2412.01814},
year = {2025}
}
备注
CVPR 2025