高保真语音再生及其在语音增强中的应用
声音
2021-02-02 v1 机器学习
音频与语音处理
摘要
近年来,语音增强取得了巨大进步,主要得益于去噪、说话人分离和去混响方法的贡献,这些方法大多处理环境效应对人声音频的影响。为了超越原始信号的局限来增强语音,我们采用再生方法,从语音的本质(包括半识别语音、韵律特征和身份)重新生成语音。我们提出了一种用于语音的波形到波形(wav-to-wav)生成模型,该模型能以实时方式生成 24khz 语音,并利用由 ASR 和身份特征组成的紧凑语音表示来实现更高水平的可懂度。受语音转换方法启发,我们训练以在保留源身份的同时增强语音特征,使用辅助身份网络。感知声学度量和主观测试表明,该方法相比近期基线获得了有价值的改进。
引用
@article{arxiv.2102.00429,
title = {High Fidelity Speech Regeneration with Application to Speech Enhancement},
author = {Adam Polyak and Lior Wolf and Yossi Adi and Ori Kabeli and Yaniv Taigman},
journal= {arXiv preprint arXiv:2102.00429},
year = {2021}
}