基于人类在回环适应的演唱声乐器分离持续学习
声音
2025-12-03 v1
摘要
基于深度学习的演唱声乐器分离方法近年来表现卓越。然而,这些方法大多不关注允许用户与模型交互以提升性能。当模型在实际场景中部署时,音乐轨道可能因曲风和乐器的差异而与原始训练数据有所不同,这种情况尤为关键。本文提出了一种基于深度学习的交互式持续学习框架,用于演唱声乐器分离,允许用户微调声乐器分离模型以适应新的目标歌曲。我们采用基于 U-Net 的基座模型架构,用于从声谱图中提取分离人声的掩码,随后引入人类在回环任务,用户通过标记少量误报区域(即应为静音的提取声乐器区域)提供反馈。我们提出了两种持续学习算法。实验结果表明,所提算法在同一数据集内和跨数据集设置下均显著优于基座模型。
引用
@article{arxiv.2512.02432,
title = {Continual Learning for Singing Voice Separation with Human in the Loop Adaptation},
author = {Ankur Gupta and Anshul Rai and Archit Bansal and Vipul Arora},
journal= {arXiv preprint arXiv:2512.02432},
year = {2025}
}
备注
Proceedings of the 26th International Symposium on Frontiers of Research in Speech and Music, 2021