中文

更好的结合:利用非配对多模态数据提升单模态模型

机器学习 2025-10-10 v1 计算机视觉与模式识别

摘要

传统的多模态学习器寻找统一的表示用于如视觉问答等任务,但高度依赖配对数据集。然而,一个被忽视且可能强大的疑问是:能否利用辅助非配对多模态数据来直接增强单一模态的表示学习?我们提出了UML:Unpaired Multimodal Learner(非配对多模态学习器),这是一种单一模型在不同模态之间交替处理输入并在各模态之间共享参数的模态无关训练范式。这种设计利用了不同模态是共享底层现实的投影这一假设,允许模型在无需显式配对的情况下从交叉模态结构中获益。理论上,在线性数据生成假设下,我们表明,利用非配对辅助数据可获得关于数据生成过程更具信息性的表示,优于单模态训练。实证上,我们表明,使用来自辅助模态(如文本、音频或图像)的非配对数据,始终能在诸多单模态目标(如图像和音频)上提高下游性能。我们的项目页面:https://unpaired-multimodal.github.io/

关键词

引用

@article{arxiv.2510.08492,
  title  = {Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models},
  author = {Sharut Gupta and Shobhita Sundaram and Chenyu Wang and Stefanie Jegelka and Phillip Isola},
  journal= {arXiv preprint arXiv:2510.08492},
  year   = {2025}
}

备注

63 pages, 29 tables, and 47 figures