中文

JOTR:基于 Transformer 的 3D 联合对比学习用于遮挡人体网格恢复

计算机视觉与模式识别 2023-08-21 v2

摘要

本研究关注单幅图像在遮挡条件下的 3D 人体网格恢复问题。大多数最先进的方法旨在改进 2D 对齐技术,如空间平均和 2D 关节采样。然而,它们往往忽视通过改进 3D 表示来实现 3D 对齐这一关键方面。此外,近期方法由于在拥挤场景中仅以 3D 关节坐标为局部监督来优化目标人体的 3D 空间,难以将目标人体从遮挡或背景中分离。为解决这些问题,理想方法需包含一个融合 2D 与 3D 特征的框架以及一种全局优化 3D 空间的策略。因此,本文提出 3D 联合对比学习与 Transformer(JOTR)框架用于处理遮挡 3D 人体网格恢复。我们的方法包括一个编码器-解码器 Transformer 架构,以由粗到细的方式融合 2D 和 3D 表示以实现 2D&\&3D 对齐结果,以及一种新颖的 3D 关节对比学习方法,为 3D 特征空间添加显式全局监督。该对比学习方法包含两种对比损失:关节到关节对比以增强语义相似体素(即人体关节)的相似性,以及关节到非关节对比以确保与其他部分(如遮挡和背景)的区分性。定性与定量分析表明,我们的方法在遮挡专用和标准基准上都优于最先进的竞争对手,显著改进了遮挡人体的重建。

关键词

引用

@article{arxiv.2307.16377,
  title  = {JOTR: 3D Joint Contrastive Learning with Transformers for Occluded Human Mesh Recovery},
  author = {Jiahao Li and Zongxin Yang and Xiaohan Wang and Jianxin Ma and Chang Zhou and Yi Yang},
  journal= {arXiv preprint arXiv:2307.16377},
  year   = {2023}
}

备注

Camera Ready Version for ICCV 2023