基于图的视觉提示:Graph-of-Mark 促进多模态语言模型中的空间推理
计算机视觉与模式识别
2026-03-27 v2 人工智能
摘要
近期训练-free 视觉提示技术,如 Set-of-Mark,已涌现为增强多模态语言模型(MLMs)定位能力的有前景方向。这些技术通过将输入图像划分为目标区域并用带有编号的框等标记进行注释,然后将增强后的图像输入到 MLMs 中工作。然而,这些方法将标记的目标视为孤立实体,未能捕捉它们之间的关系。在此基础上,我们提出 Graph-of-Mark(GoM),首个像素级视觉提示技术,通过将场景图叠加到输入图像上以进行空间推理任务。我们在 3 个开源 MLMs 和 4 个不同数据集上评估了 GoM,进行了对绘制成分的广泛消融实验,探讨了辅助图描述在文本提示中的影响。我们的结果表明,GoM 在解释目标位置和相对方向方面始终提升了 MLMs 的零样本能力,在视觉问答和定位中实现基本准确率提升了最高 11 个百分点。
引用
@article{arxiv.2603.06663,
title = {Graph-of-Mark: Promote Spatial Reasoning in Multimodal Language Models with Graph-Based Visual Prompting},
author = {Giacomo Frisoni and Lorenzo Molfetta and Mattia Buzzoni and Gianluca Moro},
journal= {arXiv preprint arXiv:2603.06663},
year = {2026}
}
备注
Please cite the definitive, copyrighted, and peer-reviewed version of this article published in AAAI 2026, edited by Sven Koenig et al., AAAI Press, Vol. 40, No. 36, Technical Track, pp. 30726-30734, 2026. DOI: https://doi.org/10.1609/aaai.v40i36.40329