中文

Modest-Align:面向视觉-语言模型的数据高效对齐

计算机视觉与模式识别 2025-10-27 v1

摘要

跨模态对齐旨在将异构模态映射到共享的潜在空间,以 CLIP 等模型为例,它们受益于大规模图像-文本预训练,从而获得了强大的识别能力。然而,在数据有限或质量低下的资源受限环境中,由于存在大量模糊或弱相关的图像-文本对,这些模型常常遭受过度自信和性能下降的问题。当前的对比学习方法依赖于单一正样本对,通过强化对不确定样本的过度自信,进一步加剧了这一问题。为应对这些挑战,我们提出了 Modest-Align,一个轻量级的对齐框架,旨在实现鲁棒性和高效性。我们的方法利用了两种互补策略——随机扰动(通过引入受控噪声来模拟不确定性)和嵌入平滑(在嵌入空间中校准相似度分布)。这些机制共同减少了过度自信,并提高了在噪声或弱对齐样本上的性能。在多个基准数据集上的大量实验表明,Modest-Align 在检索任务中优于最先进的方法,与 CLIP 相比,仅需不到 1/100 的训练数据和 1/600 的 GPU 时间即可达到具有竞争力的结果。我们的方法为现实世界中低资源场景下的跨模态对齐提供了一种实用且可扩展的解决方案。

关键词

引用

@article{arxiv.2510.21606,
  title  = {Modest-Align: Data-Efficient Alignment for Vision-Language Models},
  author = {Jiaxiang Liu and Yuan Wang and Jiawei Du and Joey Tianyi Zhou and Mingkun Xu and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2510.21606},
  year   = {2025}
}