MVRackLay:面向仓库货架的单目多视图布局估计
计算机视觉与模式识别
2022-12-08 v1 机器人学
摘要
在本文中,我们首次提出并展示了面向仓库货架的单目多视图布局估计。与典型的布局估计方法不同,MVRackLay 估计多层布局,其中每一层对应于一个货架内的布局。给定仓库场景的图像序列,一个双头 Convolutional-LSTM 架构输出分割出的货架、货架内每个架子的前视图和顶视图布局。只需极少工作量,这样的输出就被转换为所有货架、搁板及搁板上物体的 3D 渲染,从而以货架、搁板及每搁板物体数量给出整个仓库场景的精确 3D 描绘。MVRackLay 可泛化到多样的仓库场景,包括每搁板物体数量不同、搁板数量不同以及背景中存在其他此类货架的情况。此外,MVRackLay 在布局精度上相对于其单视图对应方法 RackLay 表现出更优性能,以平均 IoU 和 mAP 指标量化。我们还展示了 3D 布局的多视图拼接,得到相对于全局参考系的仓库场景表示,类似于 SLAM 流水线的场景渲染。据我们所知,这是首个以语义组件——货架、搁板和物体——从单个单目相机描绘仓库场景 3D 渲染的工作。
引用
@article{arxiv.2211.16882,
title = {MVRackLay: Monocular Multi-View Layout Estimation for Warehouse Racks and Shelves},
author = {Pranjali Pathre and Anurag Sahu and Ashwin Rao and Avinash Prabhu and Meher Shashwat Nigam and Tanvi Karandikar and Harit Pandya and K. Madhava Krishna},
journal= {arXiv preprint arXiv:2211.16882},
year = {2022}
}