AsymLoRA:在多模态大语言模型中调和数据冲突与共性
计算机视觉与模式识别
2025-02-28 v1
摘要
有效地在多样化图像-文本数据集上进行指令微调对于开发 versatile Multimodal Large Language Model(MLLM)至关重要,数据集的组成决定了模型在跨模态任务中的适应性。然而,复杂的数据集常常包含由模态特定优化目标导致的冲突,以及促进跨任务迁移的潜在共性,而大多数现有方法是分别处理这两者的。为弥合这一差距,我们引入AsymLoRA(Asymmetric LoRA),一种通过非对称LoRA实现知识模块化和跨模态协调的参数高效调优框架:针对冲突目标的任务特定低秩投影(矩阵B)保留独立的适应路径,以及共享投影(矩阵A)整合跨模态的共性。广泛的评估表明,AsymLoRA consistently 超过了仅捕获共性的 vanilla LoRA,以及仅关注冲突的 LoRA-MoE,在 diverse benchmarks 上实现卓越的模型性能和系统效率。
引用
@article{arxiv.2502.20035,
title = {AsymLoRA: Harmonizing Data Conflicts and Commonalities in MLLMs},
author = {Xuyang Wei and Chunlin Tian and Li Li},
journal= {arXiv preprint arXiv:2502.20035},
year = {2025}
}