Refine3DNet:从多视角 RGB 图像重建 3D 物体的精度提升方法
计算机视觉与模式识别
2024-12-03 v1
摘要
从多视角 2D RGB 图像生成 3D 模型已引起广泛关注,这扩展了虚拟现实、机器人视觉和人机交互等技术的能力。本文介绍一种结合 CNN 和 Transformer 的混合策略, featuring 具有自注意力机制的视觉自编码器和 3D 细化网络,采用一种新颖的联合训练分离优化(Joint Train Separate Optimization, JTSO)算法进行训练。来自无序输入的编码特征通过自注意力层转化为增强特征图,解码为初始 3D 体积,并进一步细化。我们的网络可从单张或多张任意视角的 2D 图像生成 3D 体素。使用 ShapeNet 数据集进行的性能评估表明,我们的方法结合 JTSO 在单视角和多视角 3D 重建中超越了最先进的技术,实现了最高的平均交并比(IOU)得分,较其他模型在单视角重建中提升了 4.2%。
关键词
引用
@article{arxiv.2412.00731,
title = {Refine3DNet: Scaling Precision in 3D Object Reconstruction from Multi-View RGB Images using Attention},
author = {Ajith Balakrishnan and Sreeja S and Linu Shine},
journal= {arXiv preprint arXiv:2412.00731},
year = {2024}
}
备注
ICVGIP-2024, 8 pages