中文

解构正则化:基于关节因素解构和通道感知正则化的手语生产

机器学习 2025-09-24 v3 计算机视觉与模式识别

摘要

本文提出DARSLP(Disentangle and Regularize for Sign Language Production),一个无词典、基于Transformer的手语生产(SLP)框架,直接将 spoken-language 文本映射到手势姿态序列。我们首先训练一个姿态自编码器,采用关节因素解构策略将手势姿态编码为紧凑的潜在空间。在此策略下,面部、右手、左手和身体的特征分别建模,以促进结构化和可解释的表征学习。随后,训练一个非自回归Transformer解码器,从输入句子的词级文本嵌入预测这些潜在表示。为引导此过程,我们采用KL散度损失将预测的潜在分布与从真实编码中提取的先验分布对齐。根据每个关节区域关联的贡献,对各通道损失贡献进行加权,使模型在训练期间能考虑不同关节的相对重要性。我们的方法不依赖词典监督,也不依赖预训练模型,在PHOENIX14T和CSL-Daily数据集上实现了最新的性能。

关键词

引用

@article{arxiv.2504.06610,
  title  = {Disentangle and Regularize: Sign Language Production with Articulator-Based Disentanglement and Channel-Aware Regularization},
  author = {Sumeyye Meryem Tasyurek and Tugce Kiziltepe and Hacer Yalim Keles},
  journal= {arXiv preprint arXiv:2504.06610},
  year   = {2025}
}

备注

12 pages, 7 figures, 5 tables