GLOS:带时序对齐词汇级条件的手语生成
计算机视觉与模式识别
2025-06-10 v1 计算与语言
摘要
手语生成(SLG),即文本到手语生成,填补了手语使用者与非手语使用者之间的鸿沟。尽管近期在SLG方面取得了进展,但现有方法仍常常出现词汇顺序错误和低语义准确率。这主要是由于句子级条件导致的,后者将输入文本的整个句子编码为单个特征向量作为SLG的条件,这种方法无法捕捉手语的时序结构,也缺乏词汇级语义的细粒度,常导致手势序列错乱和模糊动作。为克服这些限制,我们提出GLOS,一个具备时序对齐词汇级条件的手语生成框架。首先,我们采用词汇级条件,即与动作序列在时序上对齐的词汇嵌入序列。这使模型能够在每个时间步获取手语的时序结构和词汇级语义,从而实现对手势的细粒度控制并更好地保持词汇顺序。其次,我们引入一种条件融合模块,时序对齐条件(Temporal Alignment Conditioning, TAC),高效地将词汇级条件提供的词汇语义和时序结构传递给相应的动作时间步。我们的方法由词汇级条件和TAC组成,生成的手语具有正确的词汇顺序和高语义准确率,在 CSL-Daily 和 Phoenix-2014T 上超越了先前方法。
引用
@article{arxiv.2506.07460,
title = {GLOS: Sign Language Generation with Temporally Aligned Gloss-Level Conditioning},
author = {Taeryung Lee and Hyeongjin Nam and Gyeongsik Moon and Kyoung Mu Lee},
journal= {arXiv preprint arXiv:2506.07460},
year = {2025}
}