中文

Model-Dowser:数据无关的重要性探测以缓解多模态大语言模型中的灾难性遗忘

计算与语言 2026-05-22 v6

摘要

在特定任务数据上对多模态大语言模型 (MLLMs) 进行微调是提高下游应用程序性能的有效方法。然而,这种适应常常导致对预训练任务上通用性的下降,称为灾难性遗忘。现有方法要么在语言解码器的深层微调时变得无效,要么随模型规模增大而规模不佳。为解决这些限制,我们提出了 Model-Dowser,一种用于 MLLMs 的稀疏微调方法。Model-Dowser 通过同时考虑权重幅度、输入激活和输出灵敏度,对每个模型参数相对于预训练通用性(在下游适应之前)的重要性得分进行原则性衡量。在微调期间,Model-Dowser 选择性地保留高重要性参数并更新其余参数。在两个代表性 MLLMs 上进行的全面实验表明,Model-Dowser 有效缓解了灾难性遗忘,并持续优于先前方法,同时保持资源高效并可扩展到多数亿参数模型。

关键词

引用

@article{arxiv.2602.04509,
  title  = {Model-Dowser: Data-Free Importance Probing to Mitigate Catastrophic Forgetting in Multimodal Large Language Models},
  author = {Hyeontaek Hwang and Nguyen Dinh Son and Daeyoung Kim},
  journal= {arXiv preprint arXiv:2602.04509},
  year   = {2026}
}

备注

Accepted at ICML 2026