通过语义对齐的离散表示实现跨模态域泛化
计算机视觉与模式识别
2026-05-14 v2
摘要
多模态学习旨在整合不同感知源的信息,但现有方法在跨模态泛化性与模态特定结构之间难以取得平衡。连续(隐式)方法保留细粒度先验但使泛化困难,而离散(显式)方法则在牺牲模态特异性的同时强制共享原型。我们引入 CoDAAR(Cross-modal Discrete Alignment And Reconstruction),一种新型框架,通过索引级对齐在模态特定代码本之间建立语义共识。这种设计独特地允许 CoDAAR 在统一的离散空间中保持模态独特结构,同时实现可泛化的跨模态表示。CoDAAR 结合两种互补机制:离散时间对齐 (DTA),实现细粒度时序量化;级联语义对齐 (CSA),促进逐步跨模态语义一致。它们共同构建一个无竞争的统一表示空间。使用伴随的多模态序列的自监督重构目标训练,CoDAAR 在跨模态和跨域泛化方面表现出色。在包括事件分类、定位、视频分割和跨数据集迁移等跨模态泛化基准测试中,CoDAAR 实现了最先进的性能,确立了离散且可泛化多模态表示学习的新范式。
引用
@article{arxiv.2605.12145,
title = {Cross-Modal-Domain Generalization Through Semantically Aligned Discrete Representations},
author = {Souptik Sen and Raneen Younis and Zahra Ahmadi},
journal= {arXiv preprint arXiv:2605.12145},
year = {2026}
}
备注
Added missing affiliation for co-author R. Younis and Z. Ahmadi