中文

IRef-VLA:基于不完美语言的 3D 场景交互式指代定位基准

计算机视觉与模式识别 2025-03-25 v1 机器人学

摘要

随着大语言模型、视觉语言模型及其他通用基础模型的兴起,基于自然语言输入在多样化环境中实现多模态、多任务机器人操作的潜力日益增长。其中一种典型应用是使用自然语言指令进行室内导航。然而,尽管近期取得了进展,该问题仍具有挑战性,因需进行复杂的 3D 空间推理和语义理解。此外,所使用的语言可能不完美或与场景不一致,进一步增加了任务难度。为此,我们策划了一个基准数据集 IRef-VLA,用于交互式指代视觉语言引导动作在 3D 场景中处理不完美参考问题。IRef-VLA 是目前规模最大的真实世界数据集,包含超过 11.5 万个扫描 3D 房间、760 万个 heuristically 生成的语义关系,以及 470 万条指代语句。我们的数据集还包含语义对象和房间标注、场景图、可导航自由空间标注,并增添了语言不完美或模糊的语句。我们通过使用最新模型进行评估获取性能基准,同时开发基于场景图的图搜索基线以展示性能下界及利用场景图知识生成备选方案的能力。有了本基准,我们旨在为 3D 场景理解提供资源,促进开发健壮、交互式导航系统的发展。该数据集及全部源码已公开发布于 https://github.com/HaochenZ11/IRef-VLA。

关键词

引用

@article{arxiv.2503.17406,
  title  = {IRef-VLA: A Benchmark for Interactive Referential Grounding with Imperfect Language in 3D Scenes},
  author = {Haochen Zhang and Nader Zantout and Pujith Kachana and Ji Zhang and Wenshan Wang},
  journal= {arXiv preprint arXiv:2503.17406},
  year   = {2025}
}

备注

Accepted to ICRA 2025. Code available at https://github.com/HaochenZ11/IRef-VLA. arXiv admin note: text overlap with arXiv:2411.03540