HA-VLN 2.0:面向动态多人交互的离散与连续环境中的人类感知导航基准
人工智能
2025-10-13 v3 计算机视觉与模式识别
机器人学
摘要
视觉语言导航 (VLN) 主要在离散或连续环境中进行,很少关注动态拥挤的环境。我们提出 HA-VLN 2.0,一个引入显式社交意识约束的统一基准。我们的贡献包括:(i) 捕捉目标准确性和个人空间遵循性的标准化任务和指标;(ii) HAPS 2.0 数据集和模拟器,建模多人交互、户外环境和更细致的语言-动作对齐;(iii) 在 16,844 个社交导向指令上的基准,揭示了领先智能体在人类动态和部分可见性下的显著性能下降;以及 (iv) 现实世界机器人实验验证了仿真到现实的迁移,开放的排行榜实现透明的比较。结果表明,显式的社交建模可提高导航鲁棒性并减少碰撞,凸显了以人类为中心的方法的必要性。通过发布数据集、模拟器、基线方法和协议,HA-VLN 2.0 为安全、社会负责任的导航研究提供了坚实的基础。
引用
@article{arxiv.2503.14229,
title = {HA-VLN 2.0: An Open Benchmark and Leaderboard for Human-Aware Navigation in Discrete and Continuous Environments with Dynamic Multi-Human Interactions},
author = {Yifei Dong and Fengyi Wu and Qi He and Zhi-Qi Cheng and Heng Li and Minghan Li and Zebang Cheng and Yuxuan Zhou and Jingdong Sun and Qi Dai and Alexander G Hauptmann},
journal= {arXiv preprint arXiv:2503.14229},
year = {2025}
}
备注
33 pages, 20 figures, website: https://ha-vln-project.vercel.app/