PanoViT:用于从单张全景图像估计房间布局的视觉 Transformer
计算机视觉与模式识别
2022-12-26 v1
摘要
在本文中,我们提出 PanoViT,一种全景视觉 Transformer,用于从单张全景图像估计房间布局。与 CNN 模型相比,我们的 PanoViT 更擅长从全景图像中学习全局信息以估计复杂房间布局。考虑到透视图像与等距柱状投影图像之间的差异,我们设计了一种新颖的循环位置嵌入和一种块采样方法用于处理全景图像。除了提取全局信息外,PanoViT 还包括一个频域边缘增强模块和一个 3D 损失以提取全景图像中的局部几何特征。在多个数据集上的实验结果表明,我们的方法在房间布局预测精度上优于最先进的方案。
引用
@article{arxiv.2212.12156,
title = {PanoViT: Vision Transformer for Room Layout Estimation from a Single Panoramic Image},
author = {Weichao Shen and Yuan Dong and Zonghao Chen and Zhengyi Zhao and Yang Gao and Zhu Liu},
journal= {arXiv preprint arXiv:2212.12156},
year = {2022}
}