中文

自适应融合下利用预训练模型进行多模态类别增量学习

机器学习 2025-06-13 v1 多媒体 声音 音频与语音处理

摘要

与仅关注视觉和文本的传统多模态类别增量学习(MCIL)方法不同,本文探索跨越视觉、音频和文本模态的 MCIL,解决整合互补信息和缓解灾难性遗忘的挑战。为解决这些问题,我们提出了一种基于多模态预训练模型的 MCIL 方法。首先,引入基于专家混合(MoE)结构的多模态增量特征提取器(MIFE),以实现对 AudioCLIP 的有效增量微调。其次,为增强特征判别性和泛化能力,我们提出自适应音视频融合模块(AAVFM),包含掩码阈值机制和动态特征融合机制,以及增强文本多样性的策略。第三,提出一种新颖的多模态类别增量对比训练损失,用于优化 MCIL 中的跨模态对齐。最后,引入了两种 MCIL 特定的评估指标以进行全面评估。在三个多模态数据集上的大量实验验证了我们方法的有效性。

关键词

引用

@article{arxiv.2506.09999,
  title  = {Leveraging Pre-Trained Models for Multimodal Class-Incremental Learning under Adaptive Fusion},
  author = {Yukun Chen and Zihuan Qiu and Fanman Meng and Hongliang Li and Linfeng Xu and Qingbo Wu},
  journal= {arXiv preprint arXiv:2506.09999},
  year   = {2025}
}