中文

AsymLoRA:在多模态大语言模型中调和数据冲突与共性

计算机视觉与模式识别 2025-02-28 v1

摘要

有效地在多样化图像-文本数据集上进行指令微调对于开发 versatile Multimodal Large Language Model(MLLM)至关重要,数据集的组成决定了模型在跨模态任务中的适应性。然而,复杂的数据集常常包含由模态特定优化目标导致的冲突,以及促进跨任务迁移的潜在共性,而大多数现有方法是分别处理这两者的。为弥合这一差距,我们引入AsymLoRA(Asymmetric LoRA),一种通过非对称LoRA实现知识模块化和跨模态协调的参数高效调优框架:针对冲突目标的任务特定低秩投影(矩阵B)保留独立的适应路径,以及共享投影(矩阵A)整合跨模态的共性。广泛的评估表明,AsymLoRA consistently 超过了仅捕获共性的 vanilla LoRA,以及仅关注冲突的 LoRA-MoE,在 diverse benchmarks 上实现卓越的模型性能和系统效率。

关键词

引用

@article{arxiv.2502.20035,
  title  = {AsymLoRA: Harmonizing Data Conflicts and Commonalities in MLLMs},
  author = {Xuyang Wei and Chunlin Tian and Li Li},
  journal= {arXiv preprint arXiv:2502.20035},
  year   = {2025}
}