中文

网格增强视觉:一种提升多模态智能体空间理解的简单有效方法

计算机视觉与模式识别 2024-12-04 v2

摘要

近期多模态模型的进展已展现出惊人的目标识别和场景理解能力。然而,这些模型常在精确空间定位方面受限——这一能力对现实应用至关重要。着眼于人类运用类棋盘和地图等网格参考的方式,本文提出通过简单网格叠加方法引入显式视觉位置编码。通过在输入图像上添加 9x9 黑色网格图案,该方法提供类似于变换器中位置编码的视觉空间指导,但以显式、视觉形式呈现。针对 COCO 2017 数据集上的实验表明,网格方法在局部化精度上实现显著提升,IoU 从 0.27 提升至 0.56,提升 107.4%;GIoU 从 0.18 提升至 0.53,提升 194.4%。通过注意力可视化分析,我们展示了这种视觉位置编码如何帮助模型更好地 grounding 空间关系。该方法的简单性和有效性使其特别适用于需要精确空间推理的应用,如机器人操控、医学成像和自动驾驶导航。

关键词

引用

@article{arxiv.2411.18270,
  title  = {Grid-augmented vision: A simple yet effective approach for enhanced spatial understanding in multi-modal agents},
  author = {Joongwon Chae and Zhenyu Wang and Lian Zhang and Dongmei Yu and Peiwu Qin},
  journal= {arXiv preprint arXiv:2411.18270},
  year   = {2024}
}

备注

14 pages, 11 figures