小型古典乐团的音源分离:挑战与机遇
音频与语音处理
2025-05-26 v1 机器学习
声音
摘要
使用非因果深度学习的西方流行音乐的音乐音源分离(MSS)可以非常有效。相比之下,古典音乐的MSS仍是一个未解决的问题。由于音乐本身固有的更大变化性、用于监督训练的真实标注录音的稀缺性以及乐器之间更大的模糊性等问题,古典乐团比流行音乐更难分离。Cadenza项目一直在探索古典音乐的MSS。这样做是为了重新混音音乐,以改善听力损失人士的聆听体验。为了支持这项工作,创建了一个新的合成木管乐器数据库,以克服EnsembleSet中的乐器不平衡问题。对于MSS,使用了一组ConvTasNet模型,每个模型都经过训练以提取弦乐器或木管乐器。选择ConvTasNet是因为它能够测试因果和非因果方法。非因果方法在MSS工作中占主导地位,并且对录制音乐有用,但对于现场音乐或助听器上的处理,则需要因果信号处理。MSS性能在两个包含真实乐器录音的小型数据集(Bach10和URMP)上进行了评估,这些数据集提供了真实标注。因果和非因果系统的性能相似。将合成验证集的平均信号失真比(SDR)(因果6.2 dB;非因果6.9 dB)与真实录音评估集(因果0.3 dB,非因果0.4 dB)进行比较,表明合成数据与录音数据之间的不匹配是一个问题。未来的工作需要要么收集更多可用于训练的真实录音,要么提高合成录音的真实性和多样性以减少不匹配...
关键词
引用
@article{arxiv.2505.17823,
title = {Source Separation of Small Classical Ensembles: Challenges and Opportunities},
author = {Gerardo Roa-Dabike and Trevor J. Cox and Jon P. Barker and Michael A. Akeroyd and Scott Bannister and Bruno Fazenda and Jennifer Firth and Simone Graetzer and Alinka Greasley and Rebecca R. Vos and William M. Whitmer},
journal= {arXiv preprint arXiv:2505.17823},
year = {2025}
}
备注
5 pages, 4 figures, 2 tables, submitted to WASSPA 2025