中文

利用MMDenseNet提高实时音乐伴奏分离性能

声音 2024-07-02 v1 机器学习 音频与语音处理

摘要

音乐源分离旨在将多音乐分离为不同类型的源。大多数现有方法侧重于使用更大模型结构来提高分离结果的质量,导致不适合部署在边缘设备。此外,这些方法在输入持续时间较短时可能产生低质量输出,使其不适用于实时应用。因此,本文旨在增强轻量级模型MMDenseNet,在分离质量和延迟之间取得平衡,以适用于实时应用。本文探索或提出了不同的改进方向,包括复杂理想比值掩码、自注意力、频段合并分离方法和特征回看。采用源到失真比、实时因子和最优延迟来评估性能。为符合我们的应用要求,本文的评估过程侧重于伴奏部分的分离性能。实验结果表明,我们的改进实现了低实时因子和最优延迟,同时保持了可接受的分离质量。

关键词

引用

@article{arxiv.2407.00657,
  title  = {Improving Real-Time Music Accompaniment Separation with MMDenseNet},
  author = {Chun-Hsiang Wang and Chung-Che Wang and Jun-You Wang and Jyh-Shing Roger Jang and Yen-Hsun Chu},
  journal= {arXiv preprint arXiv:2407.00657},
  year   = {2024}
}