网格增强视觉:一种提升多模态智能体空间理解的简单有效方法
计算机视觉与模式识别
2024-12-04 v2
摘要
近期多模态模型的进展已展现出惊人的目标识别和场景理解能力。然而,这些模型常在精确空间定位方面受限——这一能力对现实应用至关重要。着眼于人类运用类棋盘和地图等网格参考的方式,本文提出通过简单网格叠加方法引入显式视觉位置编码。通过在输入图像上添加 9x9 黑色网格图案,该方法提供类似于变换器中位置编码的视觉空间指导,但以显式、视觉形式呈现。针对 COCO 2017 数据集上的实验表明,网格方法在局部化精度上实现显著提升,IoU 从 0.27 提升至 0.56,提升 107.4%;GIoU 从 0.18 提升至 0.53,提升 194.4%。通过注意力可视化分析,我们展示了这种视觉位置编码如何帮助模型更好地 grounding 空间关系。该方法的简单性和有效性使其特别适用于需要精确空间推理的应用,如机器人操控、医学成像和自动驾驶导航。
引用
@article{arxiv.2411.18270,
title = {Grid-augmented vision: A simple yet effective approach for enhanced spatial understanding in multi-modal agents},
author = {Joongwon Chae and Zhenyu Wang and Lian Zhang and Dongmei Yu and Peiwu Qin},
journal= {arXiv preprint arXiv:2411.18270},
year = {2024}
}
备注
14 pages, 11 figures