中文

将速度估计作为完全自监督的二元分类问题

声音 2024-01-18 v1 机器学习 音频与语音处理

摘要

本文探讨音乐音频中的全局速度估计问题。鉴于标注速度耗时且需要一定的音乐专业知识,用于训练此任务机器学习模型的公开可用数据源很少。为缓解这一问题,我们提出一种完全不依赖任何人工标注数据的完全自监督方法。我们的方法基于这样一个事实:通用(音乐)音频嵌入已经编码了包括速度信息在内的多种属性,使其易于适应下游任务。近期自监督速度估计工作旨在学习一个速度特定的表征,随后用于训练有监督分类器,而我们则将任务重新表述为一个二元分类问题:预测目标音轨与参考音轨的速度是否相同或不同。前者仍需标注训练数据用于最终的分类模型,而我们的方法使用任意无标注音乐数据结合时间拉伸进行模型训练,并使用一小组合成创建的参考样本预测最终速度。与当前最优方法的对比评估表明,当放宽精确速度八度查找的约束时,我们的方法表现出极具竞争力的性能。

关键词

引用

@article{arxiv.2401.08891,
  title  = {Tempo estimation as fully self-supervised binary classification},
  author = {Florian Henkel and Jaehun Kim and Matthew C. McCallum and Samuel E. Sandberg and Matthew E. P. Davies},
  journal= {arXiv preprint arXiv:2401.08891},
  year   = {2024}
}

备注

Accepted to the International Conference on Acoustics, Speech and Signal Processing (ICASSP) 2024