面向多样输入条件的通用语音增强探索
音频与语音处理
2024-02-19 v2 声音
信号处理
摘要
过去十年间,得益于深度学习,数据驱动的语音增强(SE)技术取得了显著发展。尽管现有方法在一些常用数据集上表现出令人印象深刻的性能,但大多数仅针对单一条件(例如单通道、多通道或固定采样频率)设计,或仅考虑单一任务(例如去噪或去混响)。目前,尚不存在能够以单一模型有效处理多样输入条件的通用 SE 方法。本文首次尝试探索这一研究方向。首先,我们设计了一个独立于麦克风通道、信号长度和采样频率的单一 SE 模型。其次,我们通过结合具有多种条件的现有公开语料库,设计了一个通用 SE 基准。我们在广泛数据集上的实验表明,所提出的单一模型能够以强劲性能成功处理多样条件。
引用
@article{arxiv.2309.17384,
title = {Toward Universal Speech Enhancement for Diverse Input Conditions},
author = {Wangyou Zhang and Kohei Saijo and Zhong-Qiu Wang and Shinji Watanabe and Yanmin Qian},
journal= {arXiv preprint arXiv:2309.17384},
year = {2024}
}
备注
6 pages, 3 figures, 5 tables, published in ASRU 2023 (corrected the results of noisy speech on CHiME-4 (Simu) in Table 4)