DexAvatar:基于手部和身体姿态先验的三维手语重建
计算机视觉与模式识别
2025-12-25 v1 人工智能
人机交互
机器学习
摘要
手语生成的趋势集中在数据驱动的生成方法上,这些方法需要大量精确的二维和三维人体姿态数据才能达到可接受的生成质量。然而,目前大多数手语数据集都是基于视频的,仅限于自动重建的二维人体姿态(即关键点),缺乏精确的三维信息。此外,从手语视频中进行自动三维人体姿态估计的现有最先进技术容易受到自遮挡、噪声和运动模糊效应的影响,导致重建质量不佳。为此,我们引入了 DexAvatar,这是一个新颖的框架,旨在从自然场景的单目手语视频中重建生物力学上精确的细粒度手部关节运动和身体运动,并由学习到的三维手部和身体先验引导。DexAvatar 在 SGNify 运动捕捉数据集(该任务唯一可用的基准)上取得了优异性能,与最先进技术相比,在身体和手部姿态估计方面实现了 35.11% 的提升。本工作的官方网站为:https://github.com/kaustesseract/DexAvatar。
引用
@article{arxiv.2512.21054,
title = {DexAvatar: 3D Sign Language Reconstruction with Hand and Body Pose Priors},
author = {Kaustubh Kundu and Hrishav Bakul Barua and Lucy Robertson-Bell and Zhixi Cai and Kalin Stefanov},
journal= {arXiv preprint arXiv:2512.21054},
year = {2025}
}
备注
Accepted in WACV 2026