中文

ITO:通过协同多重对齐与训练时融合实现图像与文本的统一

计算机视觉与模式识别 2026-03-10 v3 人工智能

摘要

图像-文本对比预训练已成为视觉表示学习的主导范式,但现有方法通常会产生仍部分按模态组织的表示。我们提出了ITO,一个通过两种协同机制解决这一局限性的框架。多模态多重对齐通过挖掘多样的图像-文本对应关系来丰富监督信号,而一个轻量级的训练时多模态融合模块则强制执行结构化的跨模态交互。关键在于,推理时丢弃融合模块,从而保留了标准双编码器架构的效率。大量实验表明,ITO在分类、检索和多模态基准测试中持续优于强基线。我们的分析揭示,虽然多重对齐驱动了判别能力,但训练时融合充当了关键的结构正则化器——消除模态差距并稳定训练动态,以防止在激进的对比学习中经常出现的早期饱和。

关键词

引用

@article{arxiv.2603.02767,
  title  = {ITO: Images and Texts as One via Synergizing Multiple Alignment and Training-Time Fusion},
  author = {Hanpeng Liu and Yaqian Li and Zidan Wang and Shuoxi Zhang and Zonglin Zhao and Zihao Bo and Rinyoichi Takezoe and Kaiwen Long and Kun He},
  journal= {arXiv preprint arXiv:2603.02767},
  year   = {2026}
}