中文

MIA-Bench:面向多模态大语言模型的更精准指令遵循评估基准

计算机视觉与模式识别 2025-03-21 v5 计算与语言

摘要

我们提出 MIA-Bench,这是一个新的基准测试,旨在评估多模态大语言模型(MLLM)严格遵循复杂指令的能力。该基准包含 400 对图像-指令对,每对都旨在挑战模型对具有层次指令的遵循能力,生成满足特定请求模式的准确响应。来自广泛众多最先进 MLLM 的评估结果显示,其表现存在显著差异,凸显了指令忠诚度方面的改进空间。此外,我们创建了额外的训练数据并探索了监督微调,以提升模型严格遵循指令的能力,而不损害在其他任务上的性能。我们希望该基准不仅作为衡量 MLLM 指令遵循度的工具,还能指导未来 MLLM 训练方法的发展。

关键词

引用

@article{arxiv.2407.01509,
  title  = {MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs},
  author = {Yusu Qian and Hanrong Ye and Jean-Philippe Fauconnier and Peter Grasch and Yinfei Yang and Zhe Gan},
  journal= {arXiv preprint arXiv:2407.01509},
  year   = {2025}
}

备注

Accepted at ICLR 2025