中文

LoRASculpt:雕琢LoRA以调和多模态大语言模型中的通用与专门知识

计算机视觉与模式识别 2025-03-24 v1

摘要

虽然多模态大语言模型(MLLMs)在跨模态和任务泛化方面表现出色,但如何有效适应特定下游任务同时保留通用和专门知识仍然具有挑战性。尽管低秩适应(LoRA)被广泛用于在MLLMs中高效获取专门知识,但在视觉指令微调过程中引入了大量有害冗余,这加剧了通用知识的遗忘并降低了下游任务性能。为了解决这个问题,我们提出LoRASculpt来消除有害冗余参数,从而调和通用与专门知识。具体而言,在理论保证下,我们将稀疏更新引入LoRA以有效丢弃冗余参数。此外,我们提出了一种冲突缓解正则化器来细化LoRA的更新轨迹,减轻与预训练权重的知识冲突。大量实验结果表明,即使在非常高的稀疏度(≤5%)下,我们的方法也能同时增强泛化和下游任务性能。这证实了我们的方法有效缓解了灾难性遗忘问题,并进一步促进了MLLMs中的知识调和。

关键词

引用

@article{arxiv.2503.16843,
  title  = {LoRASculpt: Sculpting LoRA for Harmonizing General and Specialized Knowledge in Multimodal Large Language Models},
  author = {Jian Liang and Wenke Huang and Guancheng Wan and Qu Yang and Mang Ye},
  journal= {arXiv preprint arXiv:2503.16843},
  year   = {2025}
}

备注

Accepted by CVPR 2025