使用混合频谱图 -TasNet 进行实时低延迟音乐源分离
音频与语音处理
2024-02-28 v1 机器学习
声音
摘要
近年来,深度学习在音乐去混音方面取得了显著进展。然而,很少有人关注如何将这些神经网络适配于实时低延迟应用,而这对于助听器、音频流混音和现场表演可能非常有用。在本文中,我们研究了将文献中当前的去混音模型适配于此用例所涉及的各种挑战。随后,受 Hybrid Demucs 架构的启发,我们提出了混合频谱图时域音频分离网络 HS-TasNet,该网络利用了频谱域和波形域的优势。对于 23 ms 的延迟,HS-TasNet 在 MusDB 测试集上获得了 4.65 的整体信噪比 (SDR),随着额外训练数据的增加,该值提升至 5.55。这些结果证明了高效去混音在实时低延迟音乐应用中的潜力。
引用
@article{arxiv.2402.17701,
title = {Real-time Low-latency Music Source Separation using Hybrid Spectrogram-TasNet},
author = {Satvik Venkatesh and Arthur Benilov and Philip Coleman and Frederic Roskam},
journal= {arXiv preprint arXiv:2402.17701},
year = {2024}
}
备注
Accepted to ICASSP 2024