中文

基于多模统一表示的开放集交叉模态泛化

计算机视觉与模式识别 2025-07-22 v1

摘要

本文将交叉模态泛化 (CMG) 扩展至开放集环境,提出更具挑战性的开放集交叉模态泛化 (OSCMG) 任务。该任务评估在开放集条件下多模统一表示的表现,旨在解决现有封闭集交叉模态评估的局限性。OSCMG 不仅要求实现跨模态知识迁移,还需对新模态中未见类别实现稳健的泛化,这种情景在实际应用中经常出现。现有的多模统一表示工作缺乏对开放集环境的考虑。为此,我们提出了 MICU,包含两个关键组件:Fine-Coarse Masked multimodal InfoNCE (FCMI) 和 Cross modal Unified Jigsaw Puzzles (CUJP)。FCMI 通过在整体语义和时间层面上应用对比学习,并引入遮蔽机制以增强泛化能力,从而提高多模态对齐效果。CUJP 通过将模态无关的特征选择与自监督学习集成,增强特征多样性和模型不确定性,从而强化模型处理未知类别的能力。在 CMG 和新提出的 OSCMG 上的大量实验验证了我们方法的有效性。代码已公开于 https://github.com/haihuangcode/CMG。

关键词

引用

@article{arxiv.2507.14935,
  title  = {Open-set Cross Modal Generalization via Multimodal Unified Representation},
  author = {Hai Huang and Yan Xia and Shulei Wang and Hanting Wang and Minghui Fang and Shengpeng Ji and Sashuai Zhou and Tao Jin and Zhou Zhao},
  journal= {arXiv preprint arXiv:2507.14935},
  year   = {2025}
}

备注

Accepted by ICCV 2025