SignDiff:用于美国手语生成的扩散模型
计算机视觉与模式识别
2025-05-01 v4
摘要
本文提出一种名为 SignDiff 的双条件扩散预训练模型,可从骨架姿态生成人手语说话者。SignDiff 具有一种新颖的帧增强网络 FR-Net,类似于密集人体姿态估计工作,其增强了文本词汇符号与手语密集姿态帧之间的对应关系,减少了扩散模型中多指现象的发生。此外,我们提出了一种用于美国手语生成(ASLP)的新方法,可从文本输入生成 ASL 骨架姿态视频,集成了两个新改进模块和一种新的损失函数,以提高手语骨架姿态的准确率和质量,并增强模型在大规模数据上训练的能力。我们提出了首个 ASL 生成基线,并在 How2Sign 开发/测试集上报告了 BLEU-4 分数 17.19 和 12.85。我们在先前主流数据集 PHOENIX14T 上评估了我们的模型,实验取得了 SOTA 结果。此外,我们的图像质量在 SSIM 方面远超以往所有结果 10 个百分点。
引用
@article{arxiv.2308.16082,
title = {SignDiff: Diffusion Model for American Sign Language Production},
author = {Sen Fang and Chunyu Sui and Yanghao Zhou and Xuedong Zhang and Hongbin Zhong and Yapeng Tian and Chen Chen},
journal= {arXiv preprint arXiv:2308.16082},
year = {2025}
}
备注
Camera-Ready Version; Project Page at https://signdiff.github.io