中文

开箱即用:真实世界中的具身导航

计算机视觉与模式识别 2021-11-03 v1 人工智能 机器人学

摘要

具身AI(Embodied AI)研究领域凭借强大的仿真平台与室内及照片级真实环境3D数据的可用性,在视觉导航与探索方面取得了实质性进展。这两大因素为新一代智能体打开了大门,其能够实现近乎完美的PointGoal Navigation。然而,此类架构通常在仿真中用数百万乃至数十亿帧训练并测试。伴随巨大热情,这些结果也引出一问题:多少研究者能切实从这些进展中受益?本工作中,我们详述如何将仿真中获得的知识迁移至真实世界。为此,我们描述了损害在Habitat模拟器上训练模型Sim2Real适应能力的架构差异,并提出了面向真实场景部署的新颖解决方案。随后我们将模型部署于LoCoBot——一种配备单Intel RealSense相机的低成本机器人。不同于先前工作,我们的测试场景在仿真中对智能体不可用。环境亦事先无法被智能体访问,故其不能依赖场景特定的语义先验。以此方式,我们复现了某研究组(可能来自其他领域)需将智能体视觉导航能力作为服务使用的设定。我们的实验表明,在真实世界部署所得模型时有可能获得令人满意的结果。我们的代码与模型见于 https://github.com/aimagelab/LoCoNav。

关键词

引用

@article{arxiv.2105.05873,
  title  = {Out of the Box: Embodied Navigation in the Real World},
  author = {Roberto Bigazzi and Federico Landi and Marcella Cornia and Silvia Cascianelli and Lorenzo Baraldi and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2105.05873},
  year   = {2021}
}