DiM\textsuperscript{3}:通过方向与幅度感知的合并桥接多语言与多模态模型
计算与语言
2026-05-21 v2
摘要
为了实现更普遍且类人类的智能,大型语言模型应能够无缝集成多语言和多模态能力;然而,为大量语言扩展现有的多模态模型,通常需要昂贵的多语言多模态数据构建和重复的端到端 retraining。我们研究了一种训练自由的替代方案:通过在共享语言模型主干中组合残差更新来将多语言能力注入现有的多模态模型。关键挑战在于,多语言和多模态更新是异构的,这反映了它们在共享模型中不同的功能角色。为此,我们提出了方向与幅度感知的 Multilingual Multimodal 合并方法(DiM3),该方法在每个参数维度上有选择性地组合这两个更新,同时保留原始视觉编码器和多模态投影器。实验在覆盖57种语言的多语言基准测试中进行,测试基于 LLaVA 和 Qwen 架构,结果表明 DiM3 在所有现有合并基线方法上均表现出色,显著提升了原始多模态模型的多语言性能,同时在很大程度上保留了通用多模态能力。我们进一步表明,DiM3 可以直接应用于已训练的多语言多模态模型,仍可获得额外的提升。进一步的可解释性分析表明,DiM3主要改变中间层的语义表征,强化了在文本和多模态输入下跨语言的对齐,同时保留了更高层次的任务敏感结构。我们的仓库位于 https://github.com/wzj1718/DiM3。
引用
@article{arxiv.2605.12960,
title = {DiM\textsuperscript{3}: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging},
author = {Zijing Wang and Mingyang Wang and Ercong Nie and Yongkang Liu and Shi Feng and Mengjie Zhao and Daling Wang and Xiaocui Yang and Hinrich Schütze},
journal= {arXiv preprint arXiv:2605.12960},
year = {2026}
}