中文

用于穿衣化身重建的全局关联三维解耦 Transformer

计算机视觉与模式识别 2023-10-24 v3 人工智能

摘要

从单张图像重建三维穿衣人体化身是一项具有挑战性的任务,尤其在遇到复杂姿态和宽松衣物时。当前方法在性能上表现出局限,主要归因于其对不充分 2D 图像特征的依赖以及不一致的查询方式。有鉴于此,我们提出用于穿衣化身(Avatar)重建的全局关联三维解耦 Transformer(GTA),一种基于 Transformer 的新颖架构,可从单目图像重建穿衣人体化身。我们的方法利用 Transformer 架构,采用 Vision Transformer 模型作为编码器以捕获全局关联图像特征。随后,我们创新的三维解耦解码器利用交叉注意力来解耦三平面(tri-plane)特征,使用可学习嵌入作为跨平面生成的查询。为有效增强与三平面三维特征及人体先验的特征融合,我们提出一种结合空间与先验增强查询的混合先验融合策略,以利用空间定位与人体先验知识的优势。在 CAPE 和 THuman2.0 数据集上的综合实验表明,我们的方法在几何与纹理重建上均优于最先进的方法,对挑战性姿态和宽松衣物表现出高鲁棒性,并生成更高分辨率的纹理。代码将发布于 https://github.com/River-Zhang/GTA。

关键词

引用

@article{arxiv.2309.13524,
  title  = {Global-correlated 3D-decoupling Transformer for Clothed Avatar Reconstruction},
  author = {Zechuan Zhang and Li Sun and Zongxin Yang and Ling Chen and Yi Yang},
  journal= {arXiv preprint arXiv:2309.13524},
  year   = {2023}
}

备注

Accepted by NeurIPS 2023. Update appendix. Project page: https://river-zhang.github.io/GTA-projectpage/