面向合成数据的音乐标签器训练
声音
2024-07-03 v1 人工智能
信息检索
机器学习
音频与语音处理
摘要
大多数当代音乐标记系统依赖大量标注数据。作为一种替代方案,我们研究合成生成的音乐片段在仅有小量标注集合的情况下能否改善标记系统的效果。为此,我们发布了GTZAN-synth,一个遵循广为人知的GTZAN数据集分类标准的数据集,数据规模是原始数据的十倍。我们首先观察到,仅仅将该合成数据集添加到GTZAN的训练 split中并不能导致性能提升。我们随后探讨了针对该任务的域适应、迁移学习和fine-tuning策略,并得出结论,后两种方法可实现准确率的提升。总体而言,本文提出的方法可被视为未来研究该领域的第一份指南。
引用
@article{arxiv.2407.02156,
title = {Towards Training Music Taggers on Synthetic Data},
author = {Nadine Kroher and Steven Manangu and Aggelos Pikrakis},
journal= {arXiv preprint arXiv:2407.02156},
year = {2024}
}
备注
6 pages, 3 figures, accepted to 21st International Conference on Content-based Multimedia Indexing (CBMI) 2024, code available https://github.com/NadineKroher/music-tagging-synthetic-data-cbmi-2024