从单目视频捕捉带手部接触的头部头像
计算机视觉与模式识别
2025-10-21 v1
摘要
全息3D头部头像对于远程办公、游戏和VR至关重要。然而,大多数方法仅关注面部区域,忽略了自然的手部-面部交互,如手放在下巴上或手指轻轻触碰面颊,这些交互传递了思考等认知状态。本文提出了一种新框架,联合学习详细的头部头像以及由手部-面部交互引起的非刚性变形。该任务有两个主要挑战:首先,单独跟踪手部和面部无法捕捉它们的相对姿态。为克服此问题,我们提出在姿态跟踪过程中结合深度顺序损失和接触正则化,以确保面部和手部之间的正确空间关系。其次,目前没有公开可用的先验用于手部引起的变形,这使得它们从单目视频中学习难以实现。为解决此问题,我们从面部-手部交互数据集中学习一套针对手部引起面部变形的PCA基。这将问题简化为估计一套紧凑的PCA参数,而而非完整的空间变形场。此外,灵感来自基于物理的仿真,我们采用接触损失提供额外的监督,显著减少穿透伪影并增强结果的物理合理性。我们在iPhone上捕获的RGB(D)视频上进行评估。此外,为了更好地评估重建的几何结构,我们构建了一个包含各种类型手部交互的合成数据集。我们展示,本方法能够捕捉更好的外观和更准确的面部变形几何,优于SOTA表面重建方法。
引用
@article{arxiv.2510.17181,
title = {Capturing Head Avatar with Hand Contacts from a Monocular Video},
author = {Haonan He and Yufeng Zheng and Jie Song},
journal= {arXiv preprint arXiv:2510.17181},
year = {2025}
}
备注
ICCV 2025