基于空间-时间 Transformer 的单目 3D 衣着人形重建消歧义
计算机视觉与模式识别
2024-10-23 v1
摘要
从单目摄像头数据重建 3D 衣着人形极具挑战性,由于视角限制和图像歧义。虽然结合参数模型先验知识的隐式函数方法取得了显著进展,但仍存在两个显著问题。首先,由于视角不可见性,人物模型的背部细节存在歧义。背部细节的质量取决于由卷积神经网络(CNN)预测的背法线图的质量。然而,CNN缺乏对全局信息的感知,导致无法理解背部纹理,结果使背部细节过于平滑。其次,单张图像因光照条件和身体运动而存在局部歧义。然而,隐式函数对歧义区域的像素变化极其敏感。为解决这些歧义,我们提出了空间-时间 Transformer(STT)网络用于 3D 衣着人形重建。采用空间 Transformer 提取全局信息以预测法线图。建立全局关联有助于网络理解人体的整体纹理和形状。同时,为弥补图像中局部歧义,采用时间 Transformer 提取相邻帧的时序特征。将时序特征纳入可增强隐式网络输入特征的准确性。此外,为获得更准确的时序特征,采用联合 token 在帧之间建立局部对应关系。在 Adobe 数据集和 MonoPerfCap 数据集上的实验结果表明,我们的方法在 state-of-the-art 方法之上,并在低光照户外条件下保持稳健的泛化能力。
引用
@article{arxiv.2410.16337,
title = {Disambiguating Monocular Reconstruction of 3D Clothed Human with Spatial-Temporal Transformer},
author = {Yong Deng and Baoxing Li and Xu Zhao},
journal= {arXiv preprint arXiv:2410.16337},
year = {2024}
}