如何为大型多模态模型教授新技能
人工智能
2026-04-22 v2 计算机视觉与模式识别
机器学习
摘要
我们如何在不抹去先前能力的前提下教会大型多模态模型(LMM)新技能?我们在五个目标技能上进行顺序微调,同时监控在八个保留基准测试上的通用能力,这些基准测试跨越三个模型家族。令人惊讶的是,我们发现对一个技能进行微调后在保留任务上的表现下降,却可以在随后对另一个技能进行微调时部分恢复。我们将这种行为追溯到输出标记分布的可衡量偏移,这种偏移通过一个简单的计数偏差探针显示,该偏差随遗忘现象而变化。基于这一洞见,我们识别出两种简单且稳健的调优配方:(i)仅更新自注意力投影层(SA Proj., learning +24.9 / held-out forgetting -0.6),以及(ii)仅更新 MLP Gate&Up 而冻结 Down 投影(+30.5 / -2.1)。在学习-遗忘权衡上,这两种方法显著优于完整 LLM 调优(+31.8 / -23.3)。我们还比较了常见的遗忘缓解方法:Learning without Forgetting (LwF)、LoRA、Mixture-of-Experts 以及权重空间插值(WiSE-FT),发现我们的选择性调优配方在学习-稳定性平衡上与之相当或更好,同时更简单,不需要回放、辅助参数或每个阶段的调优。这些结果在 LLaVA-OneVision、LLaVA-NeXT 和 Qwen2.5-VL 上都成立,确认了控制输出分布偏移通过选择要调优的组件是教会 LMM 新技能而不遗忘的关键所在。代码将公开提供。
引用
@article{arxiv.2510.08564,
title = {How to Teach Large Multimodal Models New Skills},
author = {Zhen Zhu and Yiming Gong and Yao Xiao and Yaoyao Liu and Derek Hoiem},
journal= {arXiv preprint arXiv:2510.08564},
year = {2026}
}
备注
In submission. Code is available at https://github.com/jessemelpolio/LMM_CL