基于多视角视频的 3D 手部姿态估计
计算机视觉与模式识别
2021-09-27 v1 人工智能
摘要
手部姿态估计(HPE)可用于多种人机交互应用,例如面向实体或虚拟/增强现实设备的基于手势的控制。近期工作表明视频或多视角图像携带关于手部的丰富信息,使得开发更鲁棒的 HPE 系统成为可能。本文提出 Multi-View Video-Based 3D Hand(MuViHand)数据集,包含手部的多视角视频及真值 3D 姿态标签。我们的数据集包含 4,560 段视频中超过 402,000 张合成手部图像。这些视频同时从六个不同角度捕获,具有复杂背景和随机程度的动态光照。数据由 10 个不同动画主体使用半圆形拓扑中的 12 台相机采集,其中六台跟踪相机仅聚焦于手,另外六台固定相机捕获整个身体。接下来,我们实现了 MuViHandNet,一种由图像编码器(获取手部的视觉嵌入)、循环学习器(学习时间与角度序列信息)以及带 U-Net 架构的图网络(估计最终 3D 姿态信息)组成的神经流水线。我们进行了大量实验,展示了这一新数据集的挑战性以及所提方法的有效性。消融实验显示了 MuViHandNet 中每个组件的附加价值,以及数据集中具有时间与序列信息的益处。
引用
@article{arxiv.2109.11747,
title = {Multi-View Video-Based 3D Hand Pose Estimation},
author = {Leyla Khaleghi and Alireza Sepas Moghaddam and Joshua Marshall and Ali Etemad},
journal= {arXiv preprint arXiv:2109.11747},
year = {2021}
}
备注
14 pages, 15 figures