中文

何为优质视觉指令?面向视觉指令微调的复杂视觉推理指令合成

计算机视觉与模式识别 2025-02-06 v2 计算与语言

摘要

视觉指令微调对于提升多模态大语言模型(MLLMs)的零样本泛化能力至关重要。本文旨在探究一个基本问题:"何为优质视觉指令"。通过全面的实证研究,我们发现聚焦于复杂视觉推理任务的指令尤其能有效提升 MLLMs 性能,且结果与指令复杂度相关。基于该洞见,我们开发了一种自动构建高质量复杂视觉推理指令的系统方法。我们的方法采用"合成-复杂化-重构"范式,利用多个阶段逐步提升指令复杂度同时保证质量。基于该方法,我们创建了含 32K 样本的 ComVint 数据集,并在其上微调了四个 MLLMs。实验结果一致表明所有被比较的 MLLMs 性能均得到增强,例如 LLaVA 在 MME-Perception 与 MME-Cognition 上分别提升 27.86% 与 27.60%。我们的代码与数据已公开于链接:https://github.com/RUCAIBox/ComVint。

关键词

引用

@article{arxiv.2311.01487,
  title  = {What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning},
  author = {Yifan Du and Hangyu Guo and Kun Zhou and Wayne Xin Zhao and Jinpeng Wang and Chuyuan Wang and Mingchen Cai and Ruihua Song and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2311.01487},
  year   = {2025}
}

备注

Accepted by COLING2025