中文

LLaVA 驾驭:通过模态线性表示驾驶进行视觉指令调优

计算机视觉与模式识别 2025-01-08 v2 计算与语言

摘要

多模态大语言模型(MLLMs)通过将视觉表示整合到大型语言模型(LLMs)中,显著推进了视觉任务。文本模态继承自 LLMs,赋予 MLLMs 指令跟随和情境学习等能力;而视觉模态通过利用丰富的语义内容、空间信息和 grounding 能力提升下游任务性能。这两种内在模态在 various visual tasks 中形成协同作用。我们的研究最初发现,这两种模态在视觉指令调优中存在持久的不平衡,文本往往在输出生成中占主导地位。这种不平衡在使用全参数微调和参数高效微调(PEFT)方法时均存在。随后我们发现,重新平衡这两种模态可显著降低所需的可训练参数数量,启发了进一步优化视觉指令调优的方向。我们提出模态线性表示驾驶(Modality Linear Representation-Steering, MoReS)以实现这一目标。MoReS 在模型的各个层级通过线性变换驾驶视觉表示,以实现这两种内在模态的有效再平衡。为验证我们的解决方案,我们构建了 LLaVA 驾驶(LLaVA Steering)套件,集成了我们提出的 MoReS 方法。评估结果表明,构建的 LLaVA 驾驶模型所需的可训练参数数量平均比 LoRA 少约 500 倍,同时在三个视觉基准和八项视觉问答任务中仍能实现相当的性能。最后,我们展示了 LLaVA 驾驶工厂(LLaVA Steering Factory),这是一套内部开发的平台,使研究人员能够通过组件化架构快速定制各种 MLLMs,以无缝集成最先进的模型,并评估其内在模态不平衡。

关键词

引用

@article{arxiv.2412.12359,
  title  = {LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering},
  author = {Jinhe Bi and Yujun Wang and Haokun Chen and Xun Xiao and Artur Hecker and Volker Tresp and Yunpu Ma},
  journal= {arXiv preprint arXiv:2412.12359},
  year   = {2025}
}