PESTO:基于自监督转移不变目标的实时音高估计
声音
2025-10-28 v2 人工智能
机器学习
音频与语音处理
摘要
本文引入 PESTO,即一种用于单音高估计的自监督学习方法,采用 Siamese 架构。我们的模型处理 Variable- Transform (VQT) 的单个帧,并预测音高分布。神经网络设计为对平移等价,主要归功于 Toeplitz 全连接层。此外,我们通过平移和裁切 VQT 帧构造音高平移对,并使用一种新型的基于类的转移等价目标训练我们的模型,无需注释数据。得益于这种架构和训练目标,我们的模型在保持非常轻量级 (k 参数) 的情况下实现了卓越的性能。在音乐和语音数据集 (MIR-1K、MDB-stem-synth 和 PTDB) 上的评估表明,PESTO 不仅超越了自监督基线方法,还与监督方法竞争,展现出优异的跨数据集泛化能力。最后,我们通过开发用于可流式 VQT 实现的缓存卷积来提升 PESTO 的实用性。结合我们模型的低延迟(小于 10 ms)和最小参数数量,PESTO 特别适用于实时应用。
引用
@article{arxiv.2508.01488,
title = {PESTO: Real-Time Pitch Estimation with Self-supervised Transposition-equivariant Objective},
author = {Alain Riou and Bernardo Torres and Ben Hayes and Stefan Lattner and Gaëtan Hadjeres and Gaël Richard and Geoffroy Peeters},
journal= {arXiv preprint arXiv:2508.01488},
year = {2025}
}