GenMM:用于视频和 LiDAR 的几何和时序一致的多模态数据生成
计算机视觉与模式识别
2024-06-18 v1 人工智能
机器学习
摘要
多模态合成数据生成在自动驾驶、机器人、增强/虚拟现实以及零售等领域至关重要。我们提出了一种新方法,GenMM,用于在插入时序和几何一致的 3D 对象后,对 RGB 视频和 LiDAR 扫描进行联合编辑。该方法利用参考图像和 3D 边界框无缝插入并融合新对象到目标视频中。我们使用基于扩散的视频 inpainting 模型对 2D 区域进行填充(该区域与 3D 边界框一致)。随后,我们利用最先进的语义分割和单目深度估计技术计算对象的语义边界并估计其表面深度。随后,我们采用基于几何的优化算法恢复对象的表面 3D 形状,以确保其精确位于 3D 边界框内。最后,更新与新对象表面相交的 LiDAR 光线,以反映其几何一致的深度。我们的实验表明,GenMM 在插入各种 3D 对象到视频和 LiDAR 多模态领域方面效果显著。
引用
@article{arxiv.2406.10722,
title = {GenMM: Geometrically and Temporally Consistent Multimodal Data Generation for Video and LiDAR},
author = {Bharat Singh and Viveka Kulharia and Luyu Yang and Avinash Ravichandran and Ambrish Tyagi and Ashish Shrivastava},
journal= {arXiv preprint arXiv:2406.10722},
year = {2024}
}