中文

持续跨模态泛化

计算机视觉与模式识别 2025-04-02 v1

摘要

跨模态泛化旨在从多模态对中学习共享离散表示空间,实现跨未标注模态的知识迁移。然而,实现所有模态对统一表示需要大量配对数据,这往往难以实现。鼓励大型双模态数据(例如 ImageBind)的可用性,我们探索一种持续学习方法,通过 mediator 模态逐步将新模态映射到共享离散码本中。我们提出了持续混合专家适配器(CMoE-Adapter),以保持先前知识的方式将不同模态投射到统一空间。为跨阶段对齐语义,我们引入伪模态回放(PMR)机制,借助动态扩充的码本,使模型能够像使用已学习模态一样自适应地纳入新模态。广泛在 image-text、audio-text、video-text 和 speech-text 上进行实验,表明该方法在各种跨模态泛化任务中取得优异性能。代码已包含在补充材料中。

关键词

引用

@article{arxiv.2504.00561,
  title  = {Continual Cross-Modal Generalization},
  author = {Yan Xia and Hai Huang and Minghui Fang and Zhou Zhao},
  journal= {arXiv preprint arXiv:2504.00561},
  year   = {2025}
}