中文

声调语言中无声语音的序列到序列语音重构

声音 2022-06-02 v3 人机交互 音频与语音处理

摘要

基于发音神经肌肉活动的无声语音解码(SSD)近年来已成为脑机接口(BCI)的一项热门任务。许多工作致力于从发音神经肌肉活动解码表面肌电图(sEMG)。然而,在如汉语普通话等声调语言中恢复无声语音仍十分困难。本文提出一种优化的序列到序列(Seq2Seq)方法,从基于sEMG的无声语音合成语音。我们提取时长信息,利用音频长度对基于sEMG的无声语音进行调节。随后,我们提供具有编码器-解码器结构的深度学习模型与最先进的声码器以生成音频波形。基于六名汉语普通话说话人的实验表明,所提模型能成功解码汉语普通话无声语音,并在人工评估下平均取得6.41%的字错率(CER)。

关键词

引用

@article{arxiv.2108.00190,
  title  = {Sequence-to-Sequence Voice Reconstruction for Silent Speech in a Tonal Language},
  author = {Huiyan Li and Haohong Lin and You Wang and Hengyang Wang and Ming Zhang and Han Gao and Qing Ai and Zhiyuan Luo and Guang Li},
  journal= {arXiv preprint arXiv:2108.00190},
  year   = {2022}
}