基于轻量级深度学习框架的音乐源分离(DTTNET:双路径TFC-TDF UNet)
音频与语音处理
2024-03-20 v2 声音
摘要
音乐源分离(MSS)旨在从一段混合音乐中提取“人声”、“鼓”、“贝斯”和“其他”音轨。尽管深度学习方法已展现出令人印象深刻的成果,但存在模型日益增大的趋势。在本文中,我们引入了一种名为DTTNet的新颖轻量级架构,其基于双路径模块与时空卷积时分布全连接UNet(TFC-TDF UNet)。DTTNet在“人声”上取得了10.12 dB的cSDR,而Bandsplit RNN(BSRNN)报道为10.01 dB,但参数减少了86.7%。我们还评估了针对复杂音频模式的特定模式性能与模型泛化能力。
引用
@article{arxiv.2309.08684,
title = {Music Source Separation Based on a Lightweight Deep Learning Framework (DTTNET: DUAL-PATH TFC-TDF UNET)},
author = {Junyu Chen and Susmitha Vekkot and Pancham Shukla},
journal= {arXiv preprint arXiv:2309.08684},
year = {2024}
}
备注
Accepted for ICASSP 2024. Additional experiments can be found in the published version on IEEE Xplore