中文

基于解耦模态交叉注意力与Transformer的3D人体网格恢复

计算机视觉与模式识别 2022-07-29 v1 人工智能 机器学习

摘要

Transformer编码器架构近期在单目3D人体网格重建上取得了最先进的结果,但它们需要大量参数和昂贵的计算。由于巨大的内存开销和缓慢的推理速度,此类模型难以部署于实际使用中。本文提出一种用于从单张图像进行3D人体网格重建的新型Transformer编码器-解码器架构,称为FastMETRO。我们指出基于编码器的Transformer中的性能瓶颈是由token设计引起的,该设计在输入token之间引入了高复杂度的交互。我们通过编码器-解码器架构解耦这些交互,使我们的模型所需参数更少、推理时间更短。此外,我们通过注意力掩码和网格上采样操作引入人体形态学关系的先验知识,从而实现更快收敛与更高精度。我们的FastMETRO改进了精度与效率的帕累托前沿,并在Human3.6M和3DPW上明显优于基于图像的方法。此外,我们在FreiHAND上验证了其泛化能力。

关键词

引用

@article{arxiv.2207.13820,
  title  = {Cross-Attention of Disentangled Modalities for 3D Human Mesh Recovery with Transformers},
  author = {Junhyeong Cho and Kim Youwang and Tae-Hyun Oh},
  journal= {arXiv preprint arXiv:2207.13820},
  year   = {2022}
}

备注

Accepted to ECCV 2022, Code: https://github.com/postech-ami/FastMETRO