中文

SnakeVoxFormer:基于Transformer并利用游程编码的单图像体素重建方法

计算机视觉与模式识别 2023-03-30 v1

摘要

基于深度学习的3D物体重建已取得前所未有的成果。其中,Transformer深度神经模型在计算机视觉的许多应用中表现出卓越性能。我们提出SnakeVoxFormer,一种利用Transformer从单幅图像在体素空间中进行3D物体重建的新方法。SnakeVoxFormer的输入为2D图像,输出为3D体素模型。我们方法的关键创新在于使用游程编码(RLE)以蛇形遍历体素空间,并将广阔的空间差异编码为适合Transformer编码的一维结构。随后我们使用字典编码将发现的RLE块转换为用于Transformer的token。该一维表示是一种无损3D形状数据压缩方法,可转换为仅使用约原始数据大小1%的一维数据。我们展示了不同的体素遍历策略如何影响编码与重建效果。我们将方法与最先进的从图像进行3D体素重建的方法进行比较,我们的方法比最先进方法至少提升2.8%,最高达19.8%。

关键词

引用

@article{arxiv.2303.16293,
  title  = {SnakeVoxFormer: Transformer-based Single Image\\Voxel Reconstruction with Run Length Encoding},
  author = {Jae Joong Lee and Bedrich Benes},
  journal= {arXiv preprint arXiv:2303.16293},
  year   = {2023}
}