基于信封重建生成对抗网络的手语到语音语调传递
声音
2026-04-14 v1
摘要
深度学习模型已改进手语到文本翻译,使非手语使用者更易理解签名消息。当目标是语音交流时,朴素的方法是将签名消息转换为文本,然后通过文本转语音(TTS)合成语音。然而,这种两阶段流程不可避免地将文本作为瓶颈表示,导致丢失签名中原本传达的丰富非语言信息。为解决这一限制,我们提出了一种新任务——手语到语音语调传递(Sign-to-Speech Prosody Transfer),旨在捕捉手语中表达的全局语调细微差别,并直接将其整合到合成语音中。主要挑战在于,手语与语音的对齐需要专业知识,使得标注极其昂贵,阻止构建大规模平行语料库。为克服这一困难,我们引入了SignRecGAN(Sign Reconstruction GAN),一种通过对抗学习和重建损失利用单模态数据集进行规模化训练的框架。此外,我们提出了S2PFormer(Sign-to-Prosody Transformer),一种新的模型架构,既保留了现有TTS模型的表达能力,又实现了将签名派生的语调注入合成语音。广泛的实验表明,所提方法能够合成能够忠实反映手语情感内容的语音,从而为更自然的手语交流开辟了新可能。我们的代码将在接受后公开。
引用
@article{arxiv.2604.10413,
title = {Sign-to-Speech Prosody Transfer via Sign Reconstruction-based GAN},
author = {Toranosuke Manabe and Yuto Shibata and Shinnosuke Takamichi and Yoshimitsu Aoki},
journal= {arXiv preprint arXiv:2604.10413},
year = {2026}
}
备注
Accepted to ICPR 2026