中文

做笔记能带来专注?面向多轮多模态对话学习

计算机视觉与模式识别 2025-03-11 v1

摘要

建立在大规模预训练视觉塔和语言模型之上的多模态大语言模型 (MLLMs) 在多模态理解方面展现出了强大的能力。然而,现有的多数 MLLMs 是在单轮视觉问答任务上训练的,这不能准确反映真实世界的人类对话。在本文中,我们引入了 MMDiag,一个多轮多模态对话数据集。该数据集是通过精心设计的规则和 GPT 辅助协同生成的,其特点在于问题之间、问题与图像之间以及不同图像区域之间存在强相关性;从而更贴近真实世界场景。MMDiag 作为多轮多模态对话学习的强有力基准,给 MLLMs 的定位和推理能力带来了更多挑战。进一步地,受人类视觉处理启发,我们提出了 DiagNote,一个具备多模态定位和推理能力的 MLLM。DiagNote 由两个模块(Deliberate 和 Gaze)组成,它们在多轮对话中相互交互,分别执行思维链和标注。我们通过实验证明,在与现有的 MLLMs 相比时,DiagNote 在定位以及联合处理和推理视觉与语言信息方面均具有优势。

关键词

引用

@article{arxiv.2503.07002,
  title  = {Taking Notes Brings Focus? Towards Multi-Turn Multimodal Dialogue Learning},
  author = {Jiazheng Liu and Sipeng Zheng and Börje F. Karlsson and Zongqing Lu},
  journal= {arXiv preprint arXiv:2503.07002},
  year   = {2025}
}