Sign-IDD: 基于图标解注意力离散的手语生成
计算机视觉与模式识别
2024-12-20 v2 多媒体
摘要
手语生成(SLP)旨在从文本陈述生成语义一致的手语视频,其中从文本gloss到手势pose(G2P)的转换是关键步骤。现有的G2P方法通常将手势pose视为离散的三维坐标并直接拟合,忽略了关节之间的相对位置关系。为此,我们提供了一种新观点,通过将 limb bones建模来约束关节关联和手势细节,从而提高生成姿态的准确性和自然性。在本工作中,我们提出了一种 pioneering的图标解注意力离散框架,称为Sign-IDD,专为SLP设计。Sign-IDD包含一个新颖的Iconicity Disentanglement(ID)模块,以桥接关节之间相对位置的差距。ID模块将常规的3D关节表示解耦为4D骨表示,即相邻关节之间的3D空间方向向量和1D空间距离向量。此外,引入了Attribute Controllable Diffusion(ACD)模块,以进一步约束关节关联,其中属性分离层旨在分离骨的方向和长度属性,属性控制层旨在通过利用上述属性引导姿态生成。ACD模块利用gloss嵌入作为语义条件,最终从noise嵌入生成手语姿态。在PHOENIX14T和USTC-CSL数据集上的大量实验验证了我们方法的有效性。代码可在:https://github.com/NaVi-start/Sign-IDD获取。
引用
@article{arxiv.2412.13609,
title = {Sign-IDD: Iconicity Disentangled Diffusion for Sign Language Production},
author = {Shengeng Tang and Jiayi He and Dan Guo and Yanyan Wei and Feng Li and Richang Hong},
journal= {arXiv preprint arXiv:2412.13609},
year = {2024}
}
备注
Accepted by AAAI 2025