中文

SwiftF0:快速而准确的单音调音高检测

声音 2025-08-27 v1 人工智能 机器学习 音频与语音处理

摘要

准确且实时的单音调音高估计在噪声环境下,尤其在资源受限的设备上,仍是音频处理中的开放挑战。我们提出了 \emph{SwiftF0},一种新型轻量级神经模型,为单音调音高估计树立了新的最佳水平。通过在多样化的语音、音乐和合成数据集上进行训练,并进行大量数据增强,SwiftF0 能够在声学领域实现稳健的泛化,同时保持计算效率。SwiftF0 在 10 dB 信噪比下的调和平均值(HM)达到 91.80%,超越 CREPE 等基线模型超过 12 个百分点,仅比干净音频差 2.3 个百分点。SwiftF0 只需 95,842 个参数,在 CPU 上运行速度约为 CREPE 的 42 倍,使其适用于高效、实时的部署。为解决语音语料库中缺乏完美准确基准音高的关键问题(这些语料库通常依赖于算法估计器或喉镜图信号),我们引入了 \emph{SpeechSynth}。该合成语音数据集由基于音素的语音合成模型生成,提供精确的、按需的基准音高曲线,实现更稳健的模型训练和评估。此外,我们提出了一种统一的度量标准,将六种互补的性能度量组合在一起,实现全面可靠的音高评估,并发布了开源音高基准套件。SwiftF0 的在线演示可在 https://swift-f0.github.io/,源代码可在 https://github.com/lars76/swift-f0},基准框架可在 https://github.com/lars76/pitch-benchmark。

关键词

引用

@article{arxiv.2508.18440,
  title  = {SwiftF0: Fast and Accurate Monophonic Pitch Detection},
  author = {Lars Nieradzik},
  journal= {arXiv preprint arXiv:2508.18440},
  year   = {2025}
}