V-VIPE:变分视图不变姿态嵌入
计算机视觉与模式识别
2024-07-10 v1 人工智能
摘要
学习给定二维(2D)图像中人的三维(3D)人体姿态的表示是一个具有挑战性的问题。为了降低问题的歧义性,人们常常在相机坐标空间中估计3D姿态。这会使比较两个3D姿态的任务变得困难。本文通过将估计3D姿态从2D图像的任务分解为两个步骤来解决此挑战。我们使用变分自编码器(VAE)找到一种表示3D姿态在标准坐标空间中的嵌入方式。我们将该嵌入称为变分视图不变姿态嵌入 V-VIPE。使用 V-VIPE,我们可以对2D和3D姿态进行编码,并可用于下游任务,如检索和分类。我们还可通过解码器从这些嵌入中估计3D姿态,并生成未见的3D姿态。我们的编码方式的可变性使其能够在将2D空间映射到3D空间时良好地泛化到未见的相机视角。据我们了解,V-VIPE 是唯一能够提供这种多样化应用的表示方式。代码和更多信息可在 https://v-vipe.github.io/ 查找。
引用
@article{arxiv.2407.07092,
title = {V-VIPE: Variational View Invariant Pose Embedding},
author = {Mara Levy and Abhinav Shrivastava},
journal= {arXiv preprint arXiv:2407.07092},
year = {2024}
}
备注
CVPR 2024 - RHOBIN Workshop