中文

面向端到机器人学习的空间可视化感知

计算机视觉与模式识别 2024-11-27 v1 人工智能 机器人学

摘要

近期的仿照学习进展在机器人控制和具身智能方面展现出巨大潜力,但实现跨 diverse 摄像机观察的鲁棒泛化仍是关键挑战。本文引入一种基于视频的空间感知框架,利用 3D 空间表示来解决环境可变性问题,尤其关注处理光照变化。我们的方法将一种新颖图像增强技术 AugBlender 与在互联网规模数据上训练的领先单目深度估计模型相结合。这些组件共同构成了一个旨在增强鲁棒性和适应性的协同系统。我们的结果表明,我们的方法显著提升了跨 diverse 摄像机曝光的成功率,而前述模型在此类场景下会出现性能崩溃。我们的发现凸显了基于视频的空间感知模型在推动端到机器人学习鲁棒性方面的潜力,为具身智能中可扩展、低成本的解决方案铺平了道路。

关键词

引用

@article{arxiv.2411.17458,
  title  = {Spatially Visual Perception for End-to-End Robotic Learning},
  author = {Travis Davies and Jiahuan Yan and Xiang Chen and Yu Tian and Yueting Zhuang and Yiqi Huang and Luhui Hu},
  journal= {arXiv preprint arXiv:2411.17458},
  year   = {2024}
}

备注

8 pages, 5 figures