SLASH:基于 DSP 提取绝对音高的自监督语音音高估计方法
音频与语音处理
2025-07-24 v1
摘要
我们提出了 SLASH,一种基于自监督学习 (SSL) 的语音信号音高估计方法。为了提高传统基于 SSL 的方法(这些方法主要依赖于由音高平移推导的相对音高差)的性能,我们的方法通过 1) 引入由数字信号处理 (DSP) 提取的先验音高分布,以及 2) 通过目标与可微分 DSP 提取的声谱图之间的损失来优化绝对音高。为稳定优化,使用一种新的声谱图生成方法跳过复杂的波形生成。此外,通过可微分 DSP 准确预测语音的非周期成分,增强了该方法在语音信号处理中的适用性。实验结果表明,所提出的方法在准确性上优于基准的 DSP 和 SSL 基于的音高估计方法,这归功于 SSL 和 DSP 的有效集成。
引用
@article{arxiv.2507.17208,
title = {SLASH: Self-Supervised Speech Pitch Estimation Leveraging DSP-derived Absolute Pitch},
author = {Ryo Terashima and Yuma Shirahata and Masaya Kawamura},
journal= {arXiv preprint arXiv:2507.17208},
year = {2025}
}
备注
Accepted to INTERSPEECH 2025