中文

面向动态人类互动的仿真到现实的人类感知视觉语言导航

人工智能 2024-11-05 v3 计算机视觉与模式识别 机器人学

摘要

视觉语言导航 (Vision-and-Language Navigation, VLN) 旨在开发基于人类指令进行导航的具身智能体。然而,当前的 VLN 框架常依赖静态环境和最优专家监督,限制了其实际应用场景。为此,我们提出人类感知视觉语言导航 (Human-Aware Vision-and-Language Navigation, HA-VLN),通过融合动态人类活动来扩展传统 VLN,放宽关键假设条件。我们提出了人类感知三维 (Human-Aware 3D, HA3D) 模拟器,将动态人类活动与 Matterport3D 数据集结合;以及人类感知房间到房间 (Human-Aware Room-to-Room, HA-R2R) 数据集,将 R2R 数据集扩展引入人类活动描述。为应对 HA-VLN 挑战,我们设计了专家监督的跨模态 (VLN-CM) 和非专家监督的决策变换器 (VLN-DT) 智能体,利用跨模态融合和多样化训练策略,在动态人类环境中实现有效导航。全面评估包括考虑人类活动的指标,以及对 HA-VLN 独特挑战的系统性分析,凸显了进一步提升 HA-VLN 智能体现实鲁棒性和适应性的必要性。最终本工作为具身 AI 和仿真到现实迁移提供基准和洞见,为在人类居住环境中构建更真实且具应用价值的 VLN 系统铺平了道路。

关键词

引用

@article{arxiv.2406.19236,
  title  = {Human-Aware Vision-and-Language Navigation: Bridging Simulation to Reality with Dynamic Human Interactions},
  author = {Heng Li and Minghan Li and Zhi-Qi Cheng and Yifei Dong and Yuxuan Zhou and Jun-Yan He and Qi Dai and Teruko Mitamura and Alexander G. Hauptmann},
  journal= {arXiv preprint arXiv:2406.19236},
  year   = {2024}
}

备注

Spotlight at NeurIPS 2024 D&B Track. 32 pages, 18 figures, Project Page: https://lpercc.github.io/HA3D_simulator/