中文

RMAdapter:面向视觉-语言模型的基于重建的多模态适配器

计算机视觉与模式识别 2025-12-09 v1 人工智能 机器学习 多媒体

摘要

预训练的视觉-语言模型(VLM),如CLIP,已成为多模态迁移学习的重要工具。然而,在少样本场景下微调VLM在任务特定适应与泛化之间取得平衡面临重大挑战。同时,当前研究主要集中于基于提示的适应方法,使得基于适配器的方法探索不足,揭示了显著的性能差距。为解决这些挑战,我们引入了一种新的基于重建的多模态适配器(RMAdapter),它采用双分支架构。与传统的单分支适配器不同,RMAdapter由以下部分组成:(1)通过参数高效微调注入任务特定知识的适应分支,以及(2)通过将潜在空间特征重建回原始特征空间来保留通用知识的重建分支。该设计促进了通用知识与任务特定知识之间的动态平衡。重要的是,尽管RMAdapter引入了额外的重建分支,但它经过精心优化以保持轻量级。通过在每一层局部计算重建损失并共享投影模块,整体计算开销保持在最低水平。还引入了约束条件以更好地调节判别性与泛化性之间的权衡。我们在三个代表性任务上全面评估了RMAdapter的有效性:泛化到新类别、泛化到新目标数据集和领域泛化。在不依赖数据增强或重复提示设计的情况下,我们的RMAdapter在所有评估指标上一致优于最先进方法。

关键词

引用

@article{arxiv.2512.06811,
  title  = {RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models},
  author = {Xiang Lin and Weixin Li and Shu Guo and Lihong Wang and Di Huang},
  journal= {arXiv preprint arXiv:2512.06811},
  year   = {2025}
}

备注

Accepted by AAAI 2026(Oral)