中文

基于相对表征的有限数据细粒度多模态对齐学习

计算机视觉与模式识别 2026-05-19 v1 人工智能 机器学习

摘要

多模态预训练显示出强大的泛化性能,但该范式在配对数据稀缺的领域往往难以实用。一个有前景的替代方案是后处理多模态对齐,即使用有限的配对样本对分别预训练的单模态编码器进行对齐。然而,现有方法主要关注对全局表征进行对齐,忽略了 patch-token 之间的关系。这可能阻碍迁移到需要超越粗糙样本级语义的细粒度跨模态匹配的任务。为此,我们提出一种后处理对齐方法,通过相对表征学习 token 级别的跨模态结构。具体而言,我们通过其在每个模态空间中一组可学习锚点的相似性来表示图像和文本,这些锚点被训练以诱导匹配对的成对样本在跨模态相似性模式上的一致性。尽管仅学习锚点而不使用重型投影层,本方法在零样本分类、跨模态检索和零样本分割等任务上均以显著的幅度超越现有方法。这一结果凸显了在有限配对数据下建模细粒度跨模态结构对有效后处理多模态对齐的重要性。

关键词

引用

@article{arxiv.2605.16834,
  title  = {Learning Relative Representations for Fine-Grained Multimodal Alignment with Limited Data},
  author = {Shiwon Kim and Yu Rang Park},
  journal= {arXiv preprint arXiv:2605.16834},
  year   = {2026}
}