COPILOT:基于 ego-centric 视频的人体-环境碰撞预测与定位
计算机视觉与模式识别
2023-03-28 v2 机器人学
摘要
从 ego-centric 观测中预测人体与环境碰撞的能力,对于在 VR、AR 和可穿戴辅助机器人等应用中实现碰撞规避至关重要。在本工作中,我们提出了从身体佩戴相机捕获的多视角 ego-centric 视频中预测多样环境下碰撞这一具有挑战性的问题。解决该问题需要一个可泛化的感知系统,能够分类哪些人体关节将发生碰撞,并估计碰撞区域热图以在环境中定位碰撞。为此,我们提出了一种名为 COPILOT 的基于 transformer 的模型,用于同时执行碰撞预测与定位,该模型通过一种新颖的 4D 时空-视角注意力机制跨多视角输入累积信息。为训练我们的模型并支持未来在该任务上的研究,我们开发了一个合成数据生成框架,可生成虚拟人类在多样 3D 环境中移动并发生碰撞的 ego-centric 视频。该框架随后被用于建立一个由 860 万 ego-centric RGBD 帧组成的大规模数据集。大量实验表明,COPILOT 可泛化至未见的合成及真实世界场景。我们进一步通过简单的闭环控制证明 COPILOT 的输出对下游碰撞规避是有用的。请访问我们的项目网页:https://sites.google.com/stanford.edu/copilot。
引用
@article{arxiv.2210.01781,
title = {COPILOT: Human-Environment Collision Prediction and Localization from Egocentric Videos},
author = {Boxiao Pan and Bokui Shen and Davis Rempe and Despoina Paschalidou and Kaichun Mo and Yanchao Yang and Leonidas J. Guibas},
journal= {arXiv preprint arXiv:2210.01781},
year = {2023}
}