中文

SignDiff:用于美国手语生成的扩散模型

计算机视觉与模式识别 2025-05-01 v4

摘要

本文提出一种名为 SignDiff 的双条件扩散预训练模型,可从骨架姿态生成人手语说话者。SignDiff 具有一种新颖的帧增强网络 FR-Net,类似于密集人体姿态估计工作,其增强了文本词汇符号与手语密集姿态帧之间的对应关系,减少了扩散模型中多指现象的发生。此外,我们提出了一种用于美国手语生成(ASLP)的新方法,可从文本输入生成 ASL 骨架姿态视频,集成了两个新改进模块和一种新的损失函数,以提高手语骨架姿态的准确率和质量,并增强模型在大规模数据上训练的能力。我们提出了首个 ASL 生成基线,并在 How2Sign 开发/测试集上报告了 BLEU-4 分数 17.19 和 12.85。我们在先前主流数据集 PHOENIX14T 上评估了我们的模型,实验取得了 SOTA 结果。此外,我们的图像质量在 SSIM 方面远超以往所有结果 10 个百分点。

关键词

引用

@article{arxiv.2308.16082,
  title  = {SignDiff: Diffusion Model for American Sign Language Production},
  author = {Sen Fang and Chunyu Sui and Yanghao Zhou and Xuedong Zhang and Hongbin Zhong and Yapeng Tian and Chen Chen},
  journal= {arXiv preprint arXiv:2308.16082},
  year   = {2025}
}

备注

Camera-Ready Version; Project Page at https://signdiff.github.io