中文

StgcDiff:基于空间-时间图条件扩散的手势语言转换生成

计算机视觉与模式识别 2025-06-17 v1

摘要

手势语言转换生成旨在将离散的手势语言片段转换为连续的手势视频,通过合成平滑的转换实现。然而,大多数现有方法仅仅拼接孤立的手势,导致生成视频在视觉连贯性和语义准确性方面表现不佳。与文本语言不同,手势语言在空间-时间线索方面具有内在的丰富性,这使得建模更为复杂。为此,我们提出StgcDiff,一种基于图的条件扩散框架,通过捕捉手势语言独特的空间-时间依赖性来生成离散手势之间的平滑转换。具体而言,我们首先训练一个编码器-解码器架构来学习空间-时间骨架序列的结构感知表示。接着,我们优化一个以预训练编码器学习到的表示为条件的扩散去噪器,该去噪器的任务是从噪声中预测转换帧。此外,我们设计了Sign-GCN模块作为框架的关键组件,有效地建模了空间-时间特征。在PHOENIX14T、USTC-CSL100和USTC-SLR500数据集上进行的大量实验表明,我们的方法在性能上具有优势。

关键词

引用

@article{arxiv.2506.13156,
  title  = {StgcDiff: Spatial-Temporal Graph Condition Diffusion for Sign Language Transition Generation},
  author = {Jiashu He and Jiayi He and Shengeng Tang and Huixia Ben and Lechao Cheng and Richang Hong},
  journal= {arXiv preprint arXiv:2506.13156},
  year   = {2025}
}