中文

面向文本驱动的 3D 手部运动生成的教师-学生扩散模型

计算机视觉与模式识别 2026-03-26 v1

摘要

从自然语言生成逼真的 3D 手部运动对于 VR、机器人和人机交互至关重要。现有方法要么专注于全身运动,忽略了手势细节,要么需要明确的 3D 对象网格,限制了普适性。我们提出 TSHaMo,一个面向文本驱动手部运动生成的模型无关教师-学生扩散框架。学生模型仅依据文本合成运动,而教师模型则利用辅助信号(如 MANO 参数)在训练期间提供结构化指导。一种协同训练策略使学生能够受益于教师的中间预测,而在推理时仍仅使用文本。我们在 GRAB 和 H2O 上评估了两个扩散 backbone,TSHaMo 在运动质量和多样性方面均取得一致改进。消融实验确认了其在使用多样化辅助输入且无需测试时使用 3D 对象的情况下具有良好的鲁棒性和灵活性。

关键词

引用

@article{arxiv.2603.24407,
  title  = {Teacher-Student Diffusion Model for Text-Driven 3D Hand Motion Generation},
  author = {Ching-Lam Cheng and Bin Zhu and Shengfeng He},
  journal= {arXiv preprint arXiv:2603.24407},
  year   = {2026}
}

备注

5 pages, accepted by ICASSP2026