Draw-and-Understand:利用视觉提示赋能 MLLMs 理解用户意图
计算机视觉与模式识别
2025-02-25 v3
摘要
本文提出了 Draw-and-Understand 框架,探讨如何将视觉提示理解能力集成到多模态大语言模型(MLLMs)中。视觉提示允许用户通过多模态指令与模型交互,增强模型的交互性和细粒度图像理解能力。本框架提出一种通用架构,可适用于不同的预训练 MLLMs,使其能够识别各种类型的视觉提示(如点、边界框和自由形式图形)以及语言理解。此外,我们引入了 MDVP-Instruct-Data 数据集,包含 120 万张图像-视觉提示-文本三元组,涵盖自然图像、文档图像、场景文本图像、移动/网页屏幕截图和遥感图像等多个领域。基于该数据集,我们引入了 MDVP-Bench,这是一个旨在评估模型理解视觉提示指令能力的挑战性基准。实验结果表明,我们的框架可以轻松有效地应用于各种 MLLMs,如 SPHINX-X 和 LLaVA。在使用 MDVP-Instruct-Data 和图像级指令数据集训练后,模型展现出惊人的多模态交互能力和像素级理解能力,同时保持了图像级视觉感知性能。
引用
@article{arxiv.2403.20271,
title = {Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want},
author = {Weifeng Lin and Xinyu Wei and Ruichuan An and Peng Gao and Bocheng Zou and Yulin Luo and Siyuan Huang and Shanghang Zhang and Hongsheng Li},
journal= {arXiv preprint arXiv:2403.20271},
year = {2025}
}
备注
30 pages, 8 figures, 15 tables