有原则的多模态表示学习
计算机视觉与模式识别
2026-03-23 v3 机器学习
多媒体
摘要
多模态表示学习旨在通过整合不同的数据模态来创建一个统一的表示空间,以提升多模态理解。传统方法通常依赖于成对对比学习,这依赖于预定义的锚点模态,限制了跨所有模态的对齐。最近的研究探索了多模态的同步对齐,但仍存在若干挑战,例如固定锚点带来的限制以及优化奇异值乘积导致的不稳定性。为了解决这些挑战,本文提出有原则的多模态表示学习(PMRL),一种新颖的框架,它以更稳定的方式实现了无锚点依赖的多模态同步对齐。具体来说,基于完全对齐对应于秩为1的Gram矩阵这一理论洞见,PMRL优化表示矩阵的主奇异值,以使各模态沿共享的主导方向对齐。我们提出了一种基于softmax的损失函数,将奇异值视为logits以优先考虑最大的奇异值。此外,对主导特征向量进行实例级对比正则化,以保持实例间的可分性并防止表示坍缩。跨不同任务的广泛实验证明了PMRL相对于基线方法的优越性。源代码可在https://github.com/Xiaohao-Liu/PMRL获取。
引用
@article{arxiv.2507.17343,
title = {Principled Multimodal Representation Learning},
author = {Xiaohao Liu and Xiaobo Xia and See-Kiong Ng and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2507.17343},
year = {2026}
}
备注
Accepted by IEEE TPAMI 2026