中文

MMMT-IF:一个具有挑战性的多模态多轮指令跟随基准

人工智能 2024-09-30 v1 计算与语言 机器学习

摘要

评估多模态、多轮对话中的指令跟随能力具有挑战性。由于输入模型上下文中可能存在多条指令,该任务对人类评估者而言耗时,并且我们表明基于 LLM 的评判者会偏向于来自同一模型的答案。我们提出了 MMMT-IF,一个基于图像的多轮问答评估集,在问题之间添加了全局指令,约束了答案格式。这挑战了模型从长对话中检索分散的指令并在指令约束下进行推理的能力。所有指令均可通过代码执行进行客观验证。我们引入了程序化指令跟随 (PIF) 指标,用于衡量在执行推理任务时正确遵循指令的比例。PIF-N-K 指标集通过衡量语料库中每个样本的 N 个生成模型响应中至少有 K 个达到 PIF 分数为 1 的样本比例,进一步评估了鲁棒性。PIF 指标与人类指令跟随评分一致,显示出 60% 的相关性。实验表明,Gemini 1.5 Pro、GPT-4o 和 Claude 3.5 Sonnet 的 PIF 指标从第 1 轮的平均 0.81 下降到第 20 轮的 0.64。在所有轮次中,当每个响应重复 4 次 (PIF-4-4) 时,GPT-4o 和 Gemini 仅 11% 的时间成功遵循所有指令。当所有指令也被附加到模型输入上下文的末尾时,PIF 指标平均提高了 22.3 分,这表明任务的挑战不仅在于遵循指令,还在于检索分散在模型上下文中的指令。我们计划开源 MMMT-IF 数据集和指标计算代码。

关键词

引用

@article{arxiv.2409.18216,
  title  = {MMMT-IF: A Challenging Multimodal Multi-Turn Instruction Following Benchmark},
  author = {Elliot L. Epstein and Kaisheng Yao and Jing Li and Xinyi Bai and Hamid Palangi},
  journal= {arXiv preprint arXiv:2409.18216},
  year   = {2024}
}

备注

24 pages, 16 figures