基于语音词元生成的低延迟语音增强
声音
2024-01-24 v3 多媒体
音频与语音处理
摘要
现有基于深度学习的语音增强主要采用数据驱动方法,其利用大量含多种噪声类型的数据来实现从带噪信号中去除噪声。然而,对数据的高度依赖限制了其在真实环境中未见复杂噪声上的泛化能力。本文关注低延迟场景,并将语音增强视为以带噪信号为条件的语音生成问题,即我们生成干净语音而非识别并去除噪声。具体而言,我们提出一种用于语音增强的条件生成框架,其通过神经语音编解码器的声学码对干净语音建模,并以自回归方式基于过往带噪帧生成语音码。此外,我们提出一种显式对齐方法,将带噪帧与生成的语音词元对齐,以提升对不同输入长度的鲁棒性与可扩展性。不同于其他利用多阶段生成语音码的方法,我们基于 TF-Codec 神经编解码器采用单阶段语音生成方法,以低延迟实现高语音质量。在合成与真实录制测试集上的大量结果表明,其在噪声鲁棒性与时间语音连贯性方面优于数据驱动方法。
引用
@article{arxiv.2310.08981,
title = {Low-latency Speech Enhancement via Speech Token Generation},
author = {Huaying Xue and Xiulian Peng and Yan Lu},
journal= {arXiv preprint arXiv:2310.08981},
year = {2024}
}
备注
5 pages, ICASSP2024(accepted)