中文

Sanidha:面向卡尔纳蒂族音乐的工作室质量多模态数据集

声音 2025-07-22 v1 数字图书馆 机器学习 音频与语音处理

摘要

音源分离将一段音乐分割为其各个声源(人声、打击乐器、旋律乐器等),这是一项没有简单数学解法的任务。它需要依赖于在大型隔离音乐 stems 数据集上进行深度学习训练。目前最常用的数据集来自商业西方音乐,限制了模型在非西方风格(如卡尔纳蒂族音乐)中的应用。卡尔纳蒂族音乐是一种口头传统,其可用的多轨录音包含重叠声音和声源之间的干扰。这给了像 Spleeter 和 Hybrid Demucs 等商业音源分离模型带来挑战。本文介绍了“Sanidha”,这是第一个开源的、为卡尔纳蒂族音乐设计的新型数据集,提供工作室质量的多轨录音,几乎没有重叠或干扰。除了音频文件,我们还提供了艺术家表演的高清视频。此外,我们对 Spleeter(最常用的音源分离模型之一)进行微调,并在针对卡尔纳蒂族多轨数据集的微调结果上观察到 SDR 性能的提升。经微调后的模型输出通过听觉研究进行评估。

关键词

引用

@article{arxiv.2501.06959,
  title  = {Sanidha: A Studio Quality Multi-Modal Dataset for Carnatic Music},
  author = {Venkatakrishnan Vaidyanathapuram Krishnan and Noel Alben and Anish Nair and Nathaniel Condit-Schultz},
  journal= {arXiv preprint arXiv:2501.06959},
  year   = {2025}
}

备注

Accepted to the 25th International Society for Music Information Retrieval Conference (ISMIR 2024)