RGB2Point:基于 Transformer 的单 RGB 图像生成 3D 点云
计算机视觉与模式识别
2024-12-06 v4
摘要
我们提出 RGB2Point,一种基于 Transformer 的单视图 RGB 图像到 3D 点云生成方法。RGB2Point 输入一个物体的图像,并生成稠密的 3D 点云。与基于 CNN 层和扩散去噪方法的先前工作不同,我们使用预训练的 Transformer 层,具有快速生成能力,能够在 various 类别中保持一致的高质量。我们生成的点云在真实数据集上表现优异,Chamfer 距离(提高 51.15%)和 Earth Mover's 距离(提高 45.96%)指标均优于当前最先进方法。此外,我们的方法在合成数据集上表现更佳,Chamfer 距离(提高 39.26%)、Earth Mover's 距离(提高 26.95%)和 F 分数(提高 47.16%)。此外,RGB2Point 在 various 物体类别中产生 63.1% 更一致的高质�结果。就计算效率而言,RGB2Point 只需 2.3GB 的 VRAM 即可从单张 RGB 图像重建 3D 点云,且我们的实现比 SOTA 扩散模型快 15,133 倍。
引用
@article{arxiv.2407.14979,
title = {RGB2Point: 3D Point Cloud Generation from Single RGB Images},
author = {Jae Joong Lee and Bedrich Benes},
journal= {arXiv preprint arXiv:2407.14979},
year = {2024}
}
备注
Accepted to IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2025