PointArena:通过语言引导指向探测多模态接地
计算机视觉与模式识别
2025-05-20 v2
摘要
指向是语言在视觉语境中实现接地(grounding)的基本且直观的机制,应用涵盖机器人技术、辅助技术和交互式 AI 系统。尽管近期的多模态模型已开始支持指向能力,但现有基准通常仅关注指代性目标定位任务。我们引入 PointArena,一个用于评估多样化推理场景下多模态指向能力的综合平台。PointArena 包含三个组成部分:(1)Point-Bench,一个经过精心策划的数据集,涵盖五个推理类别中约 1,000 个指向任务;(2)Point-Battle,一个交互式、基于网页的竞技场,支持盲测配对模型比较,已收集超过 4,500 张匿名投票;(3)Point-Act,一个真实世界机器人操作系统,允许用户在实际环境中直接评估多模态模型的指向能力。我们对最先进的开源和专有多模态模型进行了广泛评估。结果表明 Molmo-72B 持续优于其他模型,尽管专有模型正展现出可比的性能。此外,我们发现专门针对指向任务的监督训练显著提升了模型性能。在我们的多阶段评估流程中,我们还观察到强相关性,强调了精确指向能力在使多模态模型有效连接抽象推理与具体现实世界行动中的关键作用。项目页面:https://pointarena.github.io
引用
@article{arxiv.2505.09990,
title = {PointArena: Probing Multimodal Grounding Through Language-Guided Pointing},
author = {Long Cheng and Jiafei Duan and Yi Ru Wang and Haoquan Fang and Boyang Li and Yushan Huang and Elvis Wang and Ainaz Eftekhar and Jason Lee and Wentao Yuan and Rose Hendrix and Noah A. Smith and Fei Xia and Dieter Fox and Ranjay Krishna},
journal= {arXiv preprint arXiv:2505.09990},
year = {2025}
}
备注
10 Pages, Dataset and code:https://pointarena.github.io/