中文

从任意多视角图像中恢复人体网格

计算机视觉与模式识别 2024-06-18 v4

摘要

从任意多视角图像中恢复人体网格涉及两个特性:任意的相机位姿和任意的相机视角数量。由于这种可变性,设计一个统一的框架来解决这一任务具有挑战性。这些挑战可归结为在保持灵活性的同时,能够同时估计任意相机位姿并从任意多视角图像中恢复人体网格的两难困境。为解决这一困境,我们提出了一种分而治之的框架,用于从任意多视角图像中进行统一人体网格恢复(U-HMR)。具体而言,U-HMR 包含一个解耦结构及两个主要组件:相机与人体解耦(CBD)、相机位姿估计(CPE)和任意视角融合(AVF)。由于相机位姿与人体网格相互独立,CBD 将它们的估计拆分为两个子任务,分别由两个独立的子网络(即 CPE 和 AVF)处理,从而使这两个子任务解耦。在 CPE 中,由于每个相机位姿与其他位姿无关,我们采用共享的 MLP 以并行方式处理所有视角。在 AVF 中,为了融合多视角信息并使融合操作独立于视角数量,我们引入了一个带有 SMPL 参数查询令牌的 Transformer 解码器,以提取跨视角特征用于网格恢复。为证明所提框架的有效性和灵活性以及每个组件的效果,我们在三个公开数据集 Human3.6M、MPI-INF-3DHP 和 TotalCapture 上进行了大量实验。

关键词

引用

@article{arxiv.2403.12434,
  title  = {Human Mesh Recovery from Arbitrary Multi-view Images},
  author = {Xiaoben Li and Mancheng Meng and Ziyan Wu and Terrence Chen and Fan Yang and Dinggang Shen},
  journal= {arXiv preprint arXiv:2403.12434},
  year   = {2024}
}