SignAvatar:基于Transformer的手语3D动作重建与生成
计算机视觉与模式识别
2024-12-10 v2
摘要
由于缺乏真实世界的3D手语数据、手势动作的复杂细微差别以及手语语义的跨模态理解,实现手语单词的高度表达的3D动作重建与自动生成往往颇具挑战性。为此,我们引入SignAvatar,一个能够实现单词级手语重建与生成的框架。SignAvatar采用基于Transformer的条件变分自编码器架构,有效建立不同语义模态之间的关系。此外,该方法还包含一种课程学习策略,以增强模型的鲁棒性和泛化能力,产生更真实的动作。 Furthermore, 我们贡献了ASL3DWord数据集,包含身体、手部和面部的3D关节旋转数据,用于特定手语单词。我们通过大量实验展示了SignAvatar的有效性,展示了其在重建和自动生成方面的优越性能。代码和数据集均可在项目页面获取。
引用
@article{arxiv.2405.07974,
title = {SignAvatar: Sign Language 3D Motion Reconstruction and Generation},
author = {Lu Dong and Lipisha Chaudhary and Fei Xu and Xiao Wang and Mason Lary and Ifeoma Nwogu},
journal= {arXiv preprint arXiv:2405.07974},
year = {2024}
}
备注
This work was accepted to the 2024 IEEE FG Conference. The final version is available at 10.1109/FG59268.2024.10581934