中文

MaLoRA:用于多模态 LLM 微调中的关键空间对齐的门控模态 LoRA

人工智能 2026-04-21 v2 多媒体

摘要

多模态大语言模型 (MLLM) 在处理视觉语言数据时表现出对文本输入的显著偏好,限制了其从视觉证据进行有效推理的能力。与此前归因于数据不平衡或指令微调等外部因素的研究不同,我们认为这种偏差源于模型的内部架构。具体地,我们假设视觉关键向量 (Visual Keys) 相对于语言预训练期间学习到的文本关键空间处于分布外 (OOD) 状态。因此,这些视觉关键向量在注意力计算中接收到系统性较低的相似度得分,导致其在上下文表示中被低效利用。为验证这一假设,我们从 LLaVA 和 Qwen2.5-VL 中提取关键向量,并使用定性 (t-SNE) 和定量 (Jensen-Shannon 散度) 方法分析其分布结构。结果直接表明,视觉和文本关键向量在注意力空间中占据明显不同的子空间。这种跨模态的分布差异在统计上具有显著性,其程度远超过同模态内部的差异。这些发现表明,文本偏差源于注意力关键空间内在的对齐失调,而非仅源于外部数据因素。

关键词

引用

@article{arxiv.2510.26721,
  title  = {MaLoRA: Gated Modality LoRA for Key-Space Alignment in Multimodal LLM Fine-Tuning},
  author = {Xinhan Zheng and Huyu Wu and Xueting Wang and Duo Su and Haiyun Jiang},
  journal= {arXiv preprint arXiv:2510.26721},
  year   = {2026}
}