超低延迟语音增强——一项综合研究
音频与语音处理
2024-09-17 v1 声音
摘要
对于助听设备,语音增强模型应满足通常小于5 ms的超低延迟要求。尽管已有多种低延迟技术被提出,但在使用DNN的受控环境中比较这些方法仍属空白。以往的论文在任务、训练数据、脚本和评估设置方面存在差异,使得无法进行公平比较。此外,所有方法均在小型模拟数据集上进行测试,难以公平评估其在真实世界条件下的性能,这可能影响科学发现的可靠性。为解决这些问题,我们在大规模数据上使用一致的训练全面研究了多种低延迟技术,并在真实世界数据上使用更具相关性的指标进行评估。具体而言,我们探索了非对称窗、可学习窗、自适应时域滤波器组以及未来帧预测技术的有效性。此外,我们还检验了增大模型尺寸是否能够补偿减小的窗口尺寸,以及新颖的Mamba架构在低延迟环境中的表现。
引用
@article{arxiv.2409.10358,
title = {Ultra-Low Latency Speech Enhancement - A Comprehensive Study},
author = {Haibin Wu and Sebastian Braun},
journal= {arXiv preprint arXiv:2409.10358},
year = {2024}
}