TransformerFusion:基于 Transformer 的单目 RGB 场景重建
计算机视觉与模式识别
2021-07-07 v1 图形学
机器学习
摘要
我们提出 TransformerFusion,一种基于 transformer 的三维场景重建方法。从输入的单体 RGB 视频出发,视频帧由一个 transformer 网络处理,该网络将观测融合为一个表示场景的体积特征网格;随后将该特征网格解码为隐式三维场景表示。我们方法的关键在于 transformer 架构,它使网络能够学习关注场景中每个三维位置最相关的图像帧,且仅由场景重建任务监督。特征以由粗到细的方式融合,仅在需要处存储细粒度特征,从而降低内存占用并实现交互式速率的融合。随后利用基于 MLP 的表面占据预测,从插值的由粗到细三维特征中将特征网格解码为更高分辨率的场景重建。我们的方法实现了精确的表面重建,优于最先进的多视图立体深度估计方法、全卷积三维重建方法,以及使用基于 LSTM 或 GRU 的循环网络进行视频序列融合的方法。
引用
@article{arxiv.2107.02191,
title = {TransformerFusion: Monocular RGB Scene Reconstruction using Transformers},
author = {Aljaž Božič and Pablo Palafox and Justus Thies and Angela Dai and Matthias Nießner},
journal= {arXiv preprint arXiv:2107.02191},
year = {2021}
}
备注
Video: https://youtu.be/LIpTKYfKSqw