中文

大型视觉语言模型的指令跟随能力评估

计算与语言 2025-12-30 v1 计算机视觉与模式识别

摘要

在大型语言模型(LLMs)初期的繁荣之后,提出了大量大型视觉语言模型(LVLMs),将LLMs与视觉能力相结合。然而,观察到LVLMs在使用常用训练数据集进行视觉指令调优后,往往无法展现出在集成前LLMs所具备的指令跟随能力,导致结果并未如预期那样遵循任务指令。本研究定量地表明LVLMs的指令跟随能力在微调后发生衰减,并分析其背后的原因。具体地,我们构建了新的训练数据集,突出显示输出格式是否被指定。然后,我们调查了在微调期间明确指示输出格式如何影响LVLMs的指令跟随能力。我们的定量评估确认,LVLMs在使用常用数据集进行微调后,其指令跟随能力会下降。此外,我们发现,使用包含输出格式指令的数据集训练的LVLMs比不包含此类数据集的模型更能准确地遵循指令。这些发现表明,在(视觉)指令调优期间包括具有输出格式指令的样本,有助于缓解指令跟随能力的下降。

关键词

引用

@article{arxiv.2512.23572,
  title  = {Instruction-Following Evaluation of Large Vision-Language Models},
  author = {Daiki Shiono and Shumpei Miyawaki and Ryota Tanaka and Jun Suzuki},
  journal= {arXiv preprint arXiv:2512.23572},
  year   = {2025}
}

备注

21 pages, 7 figures