中文

MS2SL:基于多模态语音数据的连续手语生产

计算与语言 2024-07-19 v1 人工智能

摘要

手语理解取得了显著进展,但尚无可行方案可直接从整个spoken content(如文本或语音)生成手语序列。本文提出一种统一框架,用于连续手语生产,简化手语用户与非手语用户间的沟通。具体而言,设计一种序列扩散模型,利用从文本或语音中提取的嵌入逐步生成手语预测。此外,通过创建文本、音频和手语的联合嵌入空间,将这些模态绑定在一起,并利用其间的语义一致性提供有益反馈用于模型训练。这种嵌入一致性学习策略减少了对手语三元组的依赖,即使缺失音频模态也能实现持续模型精炼。在How2Sign和PHOENIX14T数据集上的实验表明,我们的模型在手语生产方面实现了具竞争力的性能。

关键词

引用

@article{arxiv.2407.12842,
  title  = {MS2SL: Multimodal Spoken Data-Driven Continuous Sign Language Production},
  author = {Jian Ma and Wenguan Wang and Yi Yang and Feng Zheng},
  journal= {arXiv preprint arXiv:2407.12842},
  year   = {2024}
}

备注

Accepted to ACL 2024 Findings; Project Page: https://hechang25.github.io/MS2SL