中文

CalFuse:基于特征校准与参数融合的多模态持续学习

计算机视觉与模式识别 2025-10-29 v8

摘要

随着大规模视觉识别系统中多模态数据的激增,使模型能够从不断演进的数据流中持续获取知识,同时保留先验信息,变得日益关键。类别持续学习(CCL)通过在不重新访问历史数据的情况下增量地整合新类知识来应对这一挑战,这使其成为现实世界大数据应用的关键。传统的 CCL 方法仅依赖视觉特征,而 CLIP 等视觉语言模型(VLMs)的最新进展通过利用预训练的多模态知识,展现了在 CCL 中的巨大潜力。然而,现有方法在缓解灾难性遗忘的同时保持 VLMs 的跨模态泛化能力方面面临挑战。为了解决这些局限性,我们提出了 CalFuse,这是一个将特征校准与参数融合相结合的框架,旨在持续学习场景中实现有效的多模态知识整合。CalFuse 引入了一种动态特征校准机制,自适应地平衡原始 CLIP 视觉表示与任务特定特征,在适应新类的同时保持模型固有的跨模态泛化能力。同时,一种基于 QR 分解的参数融合策略将新获取的知识与历史任务参数逐步整合,在顺序任务中保持学习新类表示与保留先验知识之间的平衡。在基准数据集上的大量实验验证了我们方法在大规模多模态持续学习设置中的有效性,证明了其在平均准确率和最终任务保留方面均优于 SOTA 方法。

关键词

引用

@article{arxiv.2503.18672,
  title  = {CalFuse: Multi-Modal Continual Learning via Feature Calibration and Parameter Fusion},
  author = {Juncen Guo and Siao Liu and Xiaoguang Zhu and Lianlong Sun and Liangyu Teng and Jingyi Wu and Di Li and Linxiao Gong and Weiwei Jiang and Wei Zhou and Liang Song},
  journal= {arXiv preprint arXiv:2503.18672},
  year   = {2025}
}