数据集采样率对基于深度学习的噪声消除的影响
声音
2024-06-03 v1 人工智能
音频与语音处理
摘要
背景:主动噪声消除已被研究数十年。传统技术(如快速傅里叶变换)在某些场景中存在局限性。本研究探索使用深度神经网络(DNN)作为更优的替代方案。目标:本研究旨在确定训练数据中的采样率对在移动设备处理约束下运行的轻量级高效DNN的影响。方法:我们选择了ConvTasNET网络,因其在语音分离和增强方面已被证明高效。ConvTasNET在WHAM!、LibriMix和MS-2023 DNS Challenge等数据集上进行了训练。数据集以8kHz、16kHz和48kHz的采样率进行采样,以分析采样率对噪声消除效率和效果的影响。该模型在2023年的core-i7英特尔处理器上进行了测试,评估了网络在滤除背景噪声的同时产生清晰音频的能力。结果:以较高采样率(48kHz)训练的模型在总谐波失真(THD)和生成神经语音编解码器质量预测(WARP-Q)值方面提供了更好的评估指标,表明音频质量有所提高。然而,也注意到一个权衡:较高采样率的处理时间更长。结论:在48kHz等较高采样率数据集上训练的Conv-TasNET网络,为移动设备通过语音分离和增强实现噪声消除提供了稳健的解决方案。未来工作包括进一步优化模型效率并在移动设备上进行测试。
引用
@article{arxiv.2405.20884,
title = {Effects of Dataset Sampling Rate for Noise Cancellation through Deep Learning},
author = {Brandon Colelough and Andrew Zheng},
journal= {arXiv preprint arXiv:2405.20884},
year = {2024}
}
备注
16 pages, 8 pictures, 3 tables