MM-IFEngine:迈向多模态指令遵循
计算机视觉与模式识别
2025-04-29 v2
摘要
指令遵循能力衡量了多模态大语言模型(MLLM)对用户确切意图的理解程度以及其执行是否正确。现有的多模态指令遵循训练数据匮乏,基准测试仅包含简单的原子指令,且对于要求精确输出约束的任务,其评估策略不够精确。为了解决这些问题,我们提出了 MM-IFEngine,一个用于生成高质量图像-指令对的有效流水线。我们的 MM-IFEngine 流水线生成了大规模、多样化且高质量的训练数据 MM-IFInstruct-23k,该数据适用于监督微调(SFT),并被扩展为 MM-IFDPO-23k 以用于直接偏好优化(DPO)。我们进一步引入了 MM-IFEval,这是一个具有挑战性且多样化的多模态指令遵循基准测试,它包括:(1)针对输出响应的组合级约束和与输入图像绑定的感知级约束;(2)一个结合了基于规则的评估和评判模型的综合评估流水线。我们进行了 SFT 和 DPO 实验,并证明在 MM-IFInstruct-23k 和 MM-IFDPO-23k 上微调 MLLM 在各种 IF 基准测试中取得了显著收益,例如 MM-IFEval (+10.2%)、MIA (+7.6%) 和 IFEval (+12.3%)。我们已在 https://github.com/SYuan03/MM-IFEngine 上完全开源了数据集(SFT 和 DPO)、评估代码和训练脚本。
引用
@article{arxiv.2504.07957,
title = {MM-IFEngine: Towards Multimodal Instruction Following},
author = {Shengyuan Ding and Shenxi Wu and Xiangyu Zhao and Yuhang Zang and Haodong Duan and Xiaoyi Dong and Pan Zhang and Yuhang Cao and Dahua Lin and Jiaqi Wang},
journal= {arXiv preprint arXiv:2504.07957},
year = {2025}
}