面向手语生成的文本驱动扩散模型
计算机视觉与模式识别
2025-03-21 v1
摘要
我们介绍 hfut-lmc 团队对 SLRTP 手语生成挑战赛的解决方案。该挑战旨在从文本输入生成语义对齐的手语姿态序列。为此,我们提出了一种文本驱动扩散模型(TDM)框架。在训练阶段,TDM 使用编码器对文本序列进行编码,并将其作为条件输入融入扩散模型,以生成手语姿态序列。为保证生成姿态序列的高质量和准确性,我们利用两个关键损失函数。联合损失函数 用于精确衡量和最小化生成姿态序列关节点位置与真实关节点位置之间的差异。 Similarly,骨头方向损失函数 在确保生成姿态中骨头方向与实际正确方向一致方面起着关键作用。在推理阶段,TDM 框架承担着不同的但同样重要的任务。它以带噪声的序列为起点,在文本条件的严格约束下,逐步细化和生成语义一致的手语姿态序列。我们 carefully 设计的框架在手语生成任务中表现良好,我们的解决方案在 BLEU-1 分数上达到 20.17,位列挑战赛第二名。
引用
@article{arxiv.2503.15914,
title = {Text-Driven Diffusion Model for Sign Language Production},
author = {Jiayi He and Xu Wang and Ruobei Zhang and Shengeng Tang and Yaxiong Wang and Lechao Cheng},
journal= {arXiv preprint arXiv:2503.15914},
year = {2025}
}
备注
10 pages, 7 figures