基于稀疏多视角视频的 AvatarPose:面向人类密集互动的仿 Avatar 3D 姿态估计
计算机视觉与模式识别
2024-08-21 v2
摘要
尽管人体运动捕捉取得了进展,现有的多视角方法在估计多个紧密相互作用者的3D姿态和形状时常面临挑战。这种困难源于依赖准确的2D关节估计,而在人们密切互动时由于遮挡和身体接触获取准确的2D关节估计十分困难。为此,我们提出一种新方法,利用每个个体的个人化隐式神经 Avatar 作为先验条件,显著提高了这一困难姿态估计任务的鲁棒性和精度。具体而言,通过稀疏多视角视频高效重建 Avatar 先验。重建的 Avatar 先验允许我们基于颜色和轮廓渲染损失直接优化3D姿态,规避了噪声2D检测的问题。为处理相互穿透,我们在 Avatar 的重叠形状区域上提出碰撞损失,以添加穿透约束。此外,3D姿态和 Avatar 交替优化。我们的实验结果在多个公开数据集上显示出现代水平的性能。
关键词
引用
@article{arxiv.2408.02110,
title = {AvatarPose: Avatar-guided 3D Pose Estimation of Close Human Interaction from Sparse Multi-view Videos},
author = {Feichi Lu and Zijian Dong and Jie Song and Otmar Hilliges},
journal= {arXiv preprint arXiv:2408.02110},
year = {2024}
}
备注
Project Page: https://eth-ait.github.io/AvatarPose/