中文

基于伪目标生成与域对抗训练的静默舌唇发音语音重构

音频与语音处理 2023-04-13 v1

摘要

本文研究从静默说话模式下记录的超声舌图像和光学唇部视频中进行语音重构的任务,其中人们仅激活其口内和口外发音器官而不发出声音。该任务属于发音到声学转换的范畴,也可称为静默语音接口。我们提出采用一种基于伪目标生成和域对抗训练并结合迭代训练策略的方法来改善从静默舌唇发音恢复的语音的可懂度和自然度。实验表明,与基线 TaLNet 模型相比,我们提出的方法显著改善了静默说话模式下重构语音的可懂度和自然度。当使用自动语音识别(ASR)模型衡量可懂度时,我们提出方法的词错误率(WER)较基线降低超过 15%。此外,我们提出的方法在发声发音模式下重构语音的可懂度上也优于基线,将 WER 降低约 10%。

关键词

引用

@article{arxiv.2304.05574,
  title  = {Speech Reconstruction from Silent Tongue and Lip Articulation By Pseudo Target Generation and Domain Adversarial Training},
  author = {Rui-Chen Zheng and Yang Ai and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:2304.05574},
  year   = {2023}
}

备注

To be published in ICASSP2023