中文

面向实用的实时低延迟音乐源分离

声音 2025-11-18 v1 多媒体

摘要

近年来,深度学习在音乐拆分领域取得了显著进展。然而,针对实时低延迟音乐拆分的关注仍有限,这类技术潜在应用于听力辅助器具、音频流 remix 以及现场演出等场景。此外,人们倾向于开发更大的模型,这限制了其在某些场景中的应用。在本文中,我们引入一种轻量级实时低延迟模型,称为Real-Time Single-Path TFC-TDF UNET(RT-STT),其基于Dual-Path TFC-TDF UNET(DTTNet)。在RT-STT中,我们提出了基于通道扩展的特征融合技术。我们还展示了单路径建模在实时模型中优于双路径建模的优势。此外,我们研究了量化以进一步减少推理时间。RT-STT在参数数量和推理时间上显著少于最先进的模型,同时实现了卓越的性能。

关键词

引用

@article{arxiv.2511.13146,
  title  = {Towards Practical Real-Time Low-Latency Music Source Separation},
  author = {Junyu Wu and Jie Liu and Tianrui Pan and Jie Tang and Gangshan Wu},
  journal= {arXiv preprint arXiv:2511.13146},
  year   = {2025}
}