T-Pixel2Mesh:结合全局与局部 Transformer 从单张图像生成三维网格
计算机视觉与模式识别
2024-03-21 v1
摘要
Pixel2Mesh (P2M) 是一种通过从粗到精的网格变形从单张彩色图像重建三维形状的经典方法。尽管 P2M 能够生成合理的全局形状,但其图卷积网络 (GCN) 往往产生过于平滑的结果,导致细粒度几何细节的丢失。此外,P2M 为遮挡区域生成的特征不可信,并且难以应对从合成数据到真实世界图像的域差距,这是单视图三维重建方法的一个常见挑战。为了解决这些挑战,我们受 P2M 从粗到精方法的启发,提出了一种新颖的 Transformer 增强架构,名为 T-Pixel2Mesh。具体来说,我们使用一个全局 Transformer 来控制整体形状,并使用一个局部 Transformer 通过基于图的点上采样逐步细化局部几何细节。为了增强真实世界重建效果,我们提出了简单而有效的线性尺度搜索 (LSS),它在输入预处理阶段充当提示微调。我们在 ShapeNet 上的实验展示了最先进的性能,而在真实世界数据上的结果则显示了其泛化能力。
引用
@article{arxiv.2403.13663,
title = {T-Pixel2Mesh: Combining Global and Local Transformer for 3D Mesh Generation from a Single Image},
author = {Shijie Zhang and Boyan Jiang and Keke He and Junwei Zhu and Ying Tai and Chengjie Wang and Yinda Zhang and Yanwei Fu},
journal= {arXiv preprint arXiv:2403.13663},
year = {2024}
}
备注
Received by ICASSP 2024