中文

提升 MLLMs 在视觉导向指令跟随任务中的可靠性

机器学习 2026-01-07 v1

摘要

评估多模态大语言模型(MLLMs)的指令跟随(IF)能力,对严格评估模型输出如何忠实于用户指定意图至关重要。然而,现有评估 MLLMs 指令跟随能力的基准主要聚焦于文本模态中的口头指令。这一局限使我们无法全面分析指令跟随能力,因为忽略了嵌入语义丰富视觉模态中所蕴含的隐式约束。为填补这一差距,我们引入 VC-IFEval,一个新的基准及其伴随的系统构建数据集,用于评估 MLLMs 在多模态环境下的指令跟随能力。我们的基准系统性地将视觉相关约束纳入指令设计, enables 更严格、更细粒度的评估,以衡量 MLLMs 如何与视觉输入和文本指令保持一致。此外,通过在我们的数据集上微调 MLLMs,我们实现了在视觉指令跟随准确率和依从性方面的显著提升。通过对代表性 MLLMs 进行广泛评估,我们提供了对当前模型优势与局限的新见解。

关键词

引用

@article{arxiv.2601.03198,
  title  = {Empowering Reliable Visual-Centric Instruction Following in MLLMs},
  author = {Weilei He and Feng Ju and Zhiyuan Fan and Rui Min and Minhao Cheng and Yi R. Fung},
  journal= {arXiv preprint arXiv:2601.03198},
  year   = {2026}
}

备注

Submitted to ARR Jan