中文

Synthetica:用于机器人感知的大规模合成数据

计算机视觉与模式识别 2024-10-29 v1 机器人学

摘要

基于视觉的目标检测器是机器人应用的关键基础,因为它们能提供关于环境中目标定位的宝贵信息。这些检测器需要在不同光照条件、遮挡和视觉伪影下确保高可靠性,同时还要实时运行。为这些网络收集和标注真实世界数据极其耗时且成本高昂,尤其是对于定制资产(如工业物体),这使得将其泛化到真实场景变得不可行。为此,我们提出了 Synthetica,一种用于训练鲁棒状态估计器的大规模合成数据生成方法。本文聚焦于目标检测任务,这是一个重要问题,可作为大多数状态估计问题(如姿态估计)的前端。利用来自照片级真实感光线追踪渲染器的数据,我们扩大了数据生成规模,生成了 270 万张图像,以训练高精度的实时检测 Transformer。我们提出了一系列渲染随机化和训练时数据增强技术,有助于视觉任务实现鲁棒的从模拟到真实的性能。我们在目标检测任务上展示了最先进的性能,同时检测器运行速度达到 50-100Hz,比先前的 SOTA 快 9 倍。我们进一步通过展示一个在真实世界中使用自定义物体(这些物体没有先验数据集)的流程,证明了我们的训练方法对机器人应用的有用性。我们的工作强调了在实现最快实时推理速度的同时,扩大合成数据生成规模对于鲁棒的从模拟到真实迁移的重要性。视频和补充信息可在此网址找到:https://sites.google.com/view/synthetica-vision。

关键词

引用

@article{arxiv.2410.21153,
  title  = {Synthetica: Large Scale Synthetic Data for Robot Perception},
  author = {Ritvik Singh and Jingzhou Liu and Karl Van Wyk and Yu-Wei Chao and Jean-Francois Lafleche and Florian Shkurti and Nathan Ratliff and Ankur Handa},
  journal= {arXiv preprint arXiv:2410.21153},
  year   = {2024}
}

备注

21 pages, 11 figures, 5 tables