PT43D:用于从单张高度模糊 RGB 图像生成 3D 形状的概率性 Transformer
计算机视觉与模式识别
2024-11-05 v3
摘要
从单张 RGB 图像生成 3D 形状是机器人等众多应用场景中的关键任务。当前方法通常针对包含清晰完整视觉描述的图像进行设计,未考虑常见现实情况下的遮挡或裁剪的图像。为此,我们提出基于 Transformer 的自回归模型,用于在 RGB 图像可能高度模糊观察的条件下生成 3D 形状的概率分布。为处理遮挡或视野裁剪等现实场景,我们创建了模拟的图像到形状训练数据对,以实现对真实场景的细调。随后,我们采用跨注意力机制有效识别输入图像中最相关的感兴趣区域,以实现形状生成。这使得能够推断出与输入图像具有合理多样性和强对齐性的采样形状。我们在合成数据上进行训练和测试,然后在真实数据上进行细调和测试。实验表明,该模型在两种场景下均优于最先进的方法。
引用
@article{arxiv.2405.11914,
title = {PT43D: A Probabilistic Transformer for Generating 3D Shapes from Single Highly-Ambiguous RGB Images},
author = {Yiheng Xiong and Angela Dai},
journal= {arXiv preprint arXiv:2405.11914},
year = {2024}
}
备注
10 pages, 6 figures. Accepted to BMVC 2024