PlaM:面向 MLLMs 视觉 grounding 的训练免费斜坡引导模型合并
计算与语言
2026-01-13 v1
摘要
多模态大语言模型(MLLMs)依赖其基础语言模型继承的强大语言推理能力。然而,多模态指令微调却会毁灭这一文本推理能力,削弱了多模态性能。为此,本文提出一种训练免费的框架以缓解此种退化。通过层级视觉标记遮蔽,我们揭示了 MLLMs 在不同阶段的常见三阶段模式:早期模态分离、中期模态对齐和后期模态退化。通过分析 MLLMs 在不同阶段的行为,本文提出一种斜坡引导模型合并方法,选择性地将基础语言模型参数注入 MLLMs。基于五个 MLLMs 在九个基准测试上的实验结果表明,我们的方法有效。注意力分析进一步表明,合并操作将注意力从分散、零散的模式转向对任务相关视觉区域的聚焦。我们的仓库已发布于 https://github.com/wzj1718/PlaM。
引用
@article{arxiv.2601.07645,
title = {PlaM: Training-Free Plateau-Guided Model Merging for Better Visual Grounding in MLLMs},
author = {Zijing Wang and Yongkang Liu and Mingyang Wang and Ercong Nie and Deyuan Chen and Zhengjie Zhao and Shi Feng and Daling Wang and Xiaocui Yang and Yifei Zhang and Hinrich Schütze},
journal= {arXiv preprint arXiv:2601.07645},
year = {2026}
}
备注
under review