GOAT-Bench:多模态终身导航基准
人工智能
2024-04-11 v1 机器人学
摘要
具身智能社区在视觉导航任务中取得了重大进展,探索了从 3D 坐标、物体、语言描述到图像的各种目标。然而,这些导航模型通常仅处理单一输入模态作为目标。基于目前已取得的进展,是时候向能够处理各种目标类型的通用导航模型迈进,从而实现用户与机器人更有效的交互。为实现这一目标,我们提出了 GOAT-Bench,一个用于通用导航任务(即 GO to AnyThing (GOAT))的基准。在该任务中,智能体被引导以开放词汇的方式导航至由类别名称、语言描述或图像指定的一系列目标。我们在 GOAT 任务上对单体强化学习方法和模块化方法进行了基准测试,分析了它们在不同模态下的性能、显式与隐式场景记忆的作用、它们对目标规范中噪声的鲁棒性,以及记忆在终身场景中的影响。
引用
@article{arxiv.2404.06609,
title = {GOAT-Bench: A Benchmark for Multi-Modal Lifelong Navigation},
author = {Mukul Khanna and Ram Ramrakhya and Gunjan Chhablani and Sriram Yenamandra and Theophile Gervet and Matthew Chang and Zsolt Kira and Devendra Singh Chaplot and Dhruv Batra and Roozbeh Mottaghi},
journal= {arXiv preprint arXiv:2404.06609},
year = {2024}
}