Migician: 揭示多图像 grounding 中自由形式的魔法作用
计算与语言
2025-02-19 v3 人工智能
计算机视觉与模式识别
摘要
多模态大型语言模型(MLLMs)的近期进展显著提高了其对单张图像的细粒度感知能力以及跨多图像的通用理解能力。然而,现有的MLLMs仍面临在复杂多图像场景中实现精确 grounding 挑战。为此,我们首先探索一种链式思考(CoT)框架,将单图像 grounding 与多图像理解集成。虽然部分有效,但仍不够稳定,且难以捕捉抽象视觉信息 due to its non-end-to-end nature。因此,我们引入Migician,首个能够在多图像上进行自由形式且准确 grounding 的模型。为支持此目标,我们提出了MGrounding-630k数据集,包含来自现有数据集的多图像 grounding任务数据,以及新生成的自由形式 grounding指令跟随数据。进一步,我们提出了MIG-Bench,一个专为评估多图像 grounding能力而设计的全面基准测试。实验结果表明,该模型在多图像 grounding能力方面显著优于现有最佳MLLMs,甚至超越了更大规模的70B模型。我们的代码、模型、数据集和基准测试已完全开源于https://migician-vg.github.io/。
引用
@article{arxiv.2501.05767,
title = {Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models},
author = {You Li and Heyu Huang and Chi Chen and Kaiyu Huang and Chao Huang and Zonghao Guo and Zhiyuan Liu and Jinan Xu and Yuhua Li and Ruixuan Li and Maosong Sun},
journal= {arXiv preprint arXiv:2501.05767},
year = {2025}
}
备注
21 pages, 8 figures