无声语音的数字发声
音频与语音处理
2020-10-08 v1 计算与语言
机器学习
声音
摘要
在本文中,我们考虑将无声语音进行数字发声的任务,即根据捕捉肌肉冲动的肌电图(EMG)传感器测量值,将无声默读的词语转换为可听见的语音。先前的工作集中于利用发声语音期间采集的EMG训练语音合成模型,而我们首次利用无声发音语音期间采集的EMG进行训练。我们引入了一种通过在发声信号与无声信号之间迁移音频目标,从而在无声EMG上训练的方法。与仅使用发声数据训练的基线相比,我们的方法大幅提升了由无声EMG生成音频的可懂度,在一种数据条件下将转写词错误率从64%降至4%,在另一种条件下从88%降至68%。为推动该任务的进一步发展,我们公开了新的无声与发声面部EMG测量数据集。
引用
@article{arxiv.2010.02960,
title = {Digital Voicing of Silent Speech},
author = {David Gaddy and Dan Klein},
journal= {arXiv preprint arXiv:2010.02960},
year = {2020}
}
备注
EMNLP 2020