PESTO: 基于自监督转调等变目标的基频估计方法
音频与语音处理
2025-10-28 v3 声音
摘要
本文利用自监督学习(SSL)解决基频估计问题。我们使用的SSL范式是对基频转调的等变性,这使得我们的模型在仅使用小型无标签数据集训练后,就能对单声道音频准确地进行基频估计。我们使用一个轻量级(参数少于30k)的连体神经网络,以同一音频的两个不同移调版本(由其常数Q变换表示)作为输入。为了防止模型在仅编码器的设置中坍缩,我们提出了一种新颖的基于类别的转调等变目标来捕获基频信息。此外,我们通过引入可学习的托普利兹矩阵,将网络架构设计为保转调的。我们在歌声和乐器基频估计两项任务上评估了我们的模型,结果表明我们的模型能够在任务和数据集之间泛化,同时保持轻量级,从而与低资源设备兼容并适用于实时应用。特别地,我们的结果超越了自监督基线,并缩小了基频估计中自监督方法与监督方法之间的性能差距。
引用
@article{arxiv.2309.02265,
title = {PESTO: Pitch Estimation with Self-supervised Transposition-equivariant Objective},
author = {Alain Riou and Stefan Lattner and Gaëtan Hadjeres and Geoffroy Peeters},
journal= {arXiv preprint arXiv:2309.02265},
year = {2025}
}
备注
Best Paper Award of the 24th International Society for Music Information Retrieval Conference, ISMIR 2023