中文

基于主动自适应的交互式演唱旋律提取

音频与语音处理 2024-02-13 v1 声音

摘要

从复调音频中提取主导音高是音乐信息检索和计算音乐学领域的基本任务之一。要利用机器学习完成此任务,需要大量标注音频数据来训练模型。然而,在一个域(源域,例如特定歌手或流派的歌曲)上预训练的经典模型,在从其他域(目标域)提取旋律时可能表现不佳。利用来自目标域的少量标注数据对模型进行自适应调整,可以提升此类模型的性能。在本工作中,我们提出了一种高效的交互式旋律自适应方法。我们的方法使用基于归一化真实类别概率的置信度标准,选择目标音频中需要人工标注的区域。模型利用这些标注,通过元学习自适应到目标域。我们的方法还提供了一种新颖的元学习途径,能够处理类别不平衡问题,即在目标域中仅有少数类别的少量代表性样本可用于自适应。实验结果表明,所提出的方法优于其他自适应旋律提取基线。该方法与模型无关,因此可应用于其他非自适应旋律提取模型以提升其性能。此外,我们发布了一个包含 523 个音频文件(总时长约 6.86 小时)的 Hindustani Alankaar and Raga (HAR) 数据集,旨在用于演唱旋律提取任务。

关键词

引用

@article{arxiv.2402.07599,
  title  = {Interactive singing melody extraction based on active adaptation},
  author = {Kavya Ranjan Saxena and Vipul Arora},
  journal= {arXiv preprint arXiv:2402.07599},
  year   = {2024}
}