中文

SocialNav-SUB:面向社交机器人导航场景的视觉语言模型场景理解基准测试

机器人学 2025-09-11 v1 计算机视觉与模式识别

摘要

在动态、以人类为中心的环境中,机器人导航需要基于稳健场景理解的社交合规决策。最近的视觉语言模型(VLM)显示出诸如对象识别、常识推理和情境理解等有前景的能力,这些能力与社交机器人导航的细微要求相吻合。然而,目前尚不清楚视觉语言模型是否能够准确理解复杂的社交导航场景(例如,推断代理人和人类意图之间的时空关系),这对于安全且社交合规的机器人导航至关重要。虽然一些最近的工作探索了在社交机器人导航中使用视觉语言模型的方法,但目前尚无工作系统评估其满足这些必要条件的能力。本文引入了社交导航场景理解基准测试(SocialNav-SUB),一个用于评估视觉语言模型在真实世界社交机器人导航场景下场景理解能力的视觉问答(VQA)数据集和基准测试。SocialNav-SUB 提供了一个统一框架,用于在需要空间、时空和社交推理的社交机器人导航任务中,对视觉语言模型进行人类和基于规则的基线测试。通过对最新视觉语言模型进行实验,我们发现尽管表现最好的视觉语言模型在与人类答案一致方面取得了令人鼓舞的概率,但它仍低于较简单的基于规则的方法和人类共识基线,这表明当前视觉语言模型在社交场景理解方面仍存在关键缺口。我们的基准测试为面向社交机器人导航的基础模型进一步研究设定了阶段,提供了探索如何使视觉语言模型满足实际社交机器人导航需求的框架。本文概述、代码和数据可在 https://larg.github.io/socialnav-sub 查看。

关键词

引用

@article{arxiv.2509.08757,
  title  = {SocialNav-SUB: Benchmarking VLMs for Scene Understanding in Social Robot Navigation},
  author = {Michael J. Munje and Chen Tang and Shuijing Liu and Zichao Hu and Yifeng Zhu and Jiaxun Cui and Garrett Warnell and Joydeep Biswas and Peter Stone},
  journal= {arXiv preprint arXiv:2509.08757},
  year   = {2025}
}

备注

Conference on Robot Learning (CoRL) 2025 Project site: https://larg.github.io/socialnav-sub