Model-Dowser:数据无关的重要性探测以缓解多模态大语言模型中的灾难性遗忘
计算与语言
2026-05-22 v6
摘要
在特定任务数据上对多模态大语言模型 (MLLMs) 进行微调是提高下游应用程序性能的有效方法。然而,这种适应常常导致对预训练任务上通用性的下降,称为灾难性遗忘。现有方法要么在语言解码器的深层微调时变得无效,要么随模型规模增大而规模不佳。为解决这些限制,我们提出了 Model-Dowser,一种用于 MLLMs 的稀疏微调方法。Model-Dowser 通过同时考虑权重幅度、输入激活和输出灵敏度,对每个模型参数相对于预训练通用性(在下游适应之前)的重要性得分进行原则性衡量。在微调期间,Model-Dowser 选择性地保留高重要性参数并更新其余参数。在两个代表性 MLLMs 上进行的全面实验表明,Model-Dowser 有效缓解了灾难性遗忘,并持续优于先前方法,同时保持资源高效并可扩展到多数亿参数模型。
引用
@article{arxiv.2602.04509,
title = {Model-Dowser: Data-Free Importance Probing to Mitigate Catastrophic Forgetting in Multimodal Large Language Models},
author = {Hyeontaek Hwang and Nguyen Dinh Son and Daeyoung Kim},
journal= {arXiv preprint arXiv:2602.04509},
year = {2026}
}
备注
Accepted at ICML 2026