DDD:一种感知质量优越的低响应时间基于深度神经网络的去削波器
音频与语音处理
2024-01-09 v1 声音
信号处理
摘要
削波是一种常见的非线性失真,当音频系统的输入或输出超出支持范围时就会发生。这种现象不仅损害语音质量的感知,还会影响利用受损信号的下游处理。因此,需要一种能够实时运行、鲁棒且响应时间低的语音去削波(SD)方法。在这项工作中,我们引入了DDD(Demucs-Discriminator-Declipper),一种能够实时运行的语音去削波深度神经网络(DNN),其设计上需要更低的响应时间。我们首先观察到,一个先前未经测试的可实时运行的DNN模型Demucs展现出合理的去削波性能。然后,我们利用对抗性学习目标来提升输出语音的感知质量,而不增加额外的推理开销。对严重削波语音的主观评估表明,DDD在语音质量方面大幅优于基线方法。我们进行了详细的波形和频谱分析,以深入了解DDD与基线方法相比的输出行为。最后,我们的流式模拟还表明,DDD能够实现亚十分之一秒的平均响应时间,比最先进的DNN方法快六倍。
引用
@article{arxiv.2401.03650,
title = {DDD: A Perceptually Superior Low-Response-Time DNN-based Declipper},
author = {Jayeon Yi and Junghyun Koo and Kyogu Lee},
journal= {arXiv preprint arXiv:2401.03650},
year = {2024}
}
备注
To appear, ICASSP 2024. Demo samples at https://stet-stet.github.io/DDD, repo at https://github.com/stet-stet/DDD