中文

MMCR:多模态多回合情境推理视觉语言模型的进阶

人工智能 2025-03-25 v1

摘要

与单回合对话相比,涉及多个图像的多回合对话更符合现实人机交互的需求。此外,作为训练数据,它提供了更丰富的情境推理信息,从而引导模型实现更佳性能。然而,现有视觉语言模型 (VLMs) 主要依赖单回合对话进行训练和评估。本文遵循人类对话的特征,如聚焦主题和简洁清晰的内容,我们提出了 MMCR (Multimodal Multi-turn Contextual Reasoning),一个新型数据集,包括:(1) MMCR-310k —— 最大的多图像多回合指令调谋数据集,包含 31 万个情境对话,每个对话覆盖 1-4 个图像和 4 或 8 回对话;以及 (2) MMCR-Bench —— 一个诊断性基准,涵盖 8 个领域 (人文、自然、科学、教育等) 和 40 个子主题。广泛的评估表明,使用 MMCR-310k 微调的模型在 MMCR-Bench 上实现了 5.2% 的情境准确率提升,同时在现有基准上表现出一致的改进 (+1.1% 在 AI2D,+1.2% 在 MMMU 和 MMVet)。MMCR 和 prompt engineering 将对外公开。

关键词

引用

@article{arxiv.2503.18533,
  title  = {MMCR: Advancing Visual Language Model in Multimodal Multi-Turn Contextual Reasoning},
  author = {Dawei Yan and Yang Li and Qing-Guo Chen and Weihua Luo and Peng Wang and Haokui Zhang and Chunhua Shen},
  journal= {arXiv preprint arXiv:2503.18533},
  year   = {2025}
}