建模干声轨兼容性以生成音乐混搭作品
声音
2021-03-29 v1 人工智能
音频与语音处理
摘要
音乐混搭将来自两首或多首歌曲的音频元素组合以创作新作品。为减少制作所需的时间与精力,研究者已开发可预测音频元素兼容性的算法。先前工作聚焦于混合未改动的片段,而源分离方面的进展使得利用孤立干声轨(如人声、鼓、贝斯等)创作混搭成为可能。本工作中,我们不仅利用分离出的干声轨来创作混搭,更借此训练一个预测片段组相互兼容性的模型,使用自监督与半监督方法。具体而言,我们首先构建一个随机混搭生成流水线,将经源分离获得的干声轨进行组合,并自动调整调性与速度以相匹配,因这些是高质量混搭的先决条件。为训练兼容性预测模型,我们使用来自同一歌曲的干声轨作为正例,将调性和/或速度未调整的随机干声轨组合作为负例。为改进模型并利用更多数据,我们还以“平均”样本训练:具有匹配调性与速度的随机组合,因其真实兼容性未知而视为无标签数据。为判定合成信号还是干声轨信号集合更能指示结果质量,我们在两种模型架构上实验并采用半监督学习技术训练。最后,我们对系统进行了客观与主观评估,并与标准基于规则的系统进行对比。
引用
@article{arxiv.2103.14208,
title = {Modeling the Compatibility of Stem Tracks to Generate Music Mashups},
author = {Jiawen Huang and Ju-Chiang Wang and Jordan B. L. Smith and Xuchen Song and Yuxuan Wang},
journal= {arXiv preprint arXiv:2103.14208},
year = {2021}
}
备注
This is a preprint of the paper accepted by AAAI-21. Please cite the version included in the Proceedings of the 35th AAAI Conference on Artificial Intelligence