中文

MOVER:基于体积嵌入正则化的多模态最优传输

人工智能 2025-08-19 v1

摘要

多模态学习的最新进展在很大程度上依赖于成对对比目标,以在共享嵌入空间中对齐不同的模态,如文本、视频和音频。虽然这些方法在双模态设置中有效,但它们难以泛化到多种模态,并且在高维空间中往往缺乏语义结构。在本文中,我们提出了 MOVER,一个新颖的框架,它将基于最优传输的软对齐与基于体积的几何正则化相结合,以构建语义对齐且结构化的多模态表示。通过将传输引导的匹配机制与几何体积最小化目标(GAVE)相结合,MOVER 以模态无关的方式鼓励所有模态间的一致性对齐。在文本-视频-音频检索任务上的实验表明,MOVER 在零样本和微调设置下均显著优于先前的最先进方法。进一步的分析显示,该方法对未见过的模态组合具有更好的泛化能力,并且所学嵌入空间的结构一致性更强。

关键词

引用

@article{arxiv.2508.12149,
  title  = {MOVER: Multimodal Optimal Transport with Volume-based Embedding Regularization},
  author = {Haochen You and Baojing Liu},
  journal= {arXiv preprint arXiv:2508.12149},
  year   = {2025}
}

备注

Accepted as a conference paper at CIKM 2025