中文

重新想考验 multimodal instruction tuning:一种表示视角

机器学习 2025-03-24 v3

摘要

多模态指令调优已被证明是实现零样本泛化的有效策略,通过对预训练的大型多模态模型(LMM)进行指令-following 数据的微调。然而,随着 LMM 规模的不断增大,对这些模型进行完全微调已变得非常参数密集。虽然引入参数高效微调(PEFT)方法以减少可调参数数量,但仍与完全微调之间存在显著的性能差距。此外,现有的 PEFT 方法往往高度参数化,难以解释和控制。鉴于此,我们引入多模态表示调优(MRT),这是一种新方法,侧重于直接编辑语义丰富的多模态表示,以实现卓越的性能并对 LMM 提供直观的控制。实证结果表明,我们的方法以显著的性能提升(例如 1580.40 MME 分数)超越当前最先进的基准方法,同时所需的可调参数数量大幅减少(例如仅 0.03% 参数)。此外,我们对在多模态表示中编辑仪器 token 进行了实验,表明对这些表示的直接操作可实现对网络行为的简单而有效的控制。

关键词

引用

@article{arxiv.2503.00723,
  title  = {Re-Imagining Multimodal Instruction Tuning: A Representation View},
  author = {Yiyang Liu and James Chenhao Liang and Ruixiang Tang and Yugyung Lee and Majid Rabbani and Sohail Dianat and Raghuveer Rao and Lifu Huang and Dongfang Liu and Qifan Wang and Cheng Han},
  journal= {arXiv preprint arXiv:2503.00723},
  year   = {2025}
}