FCPE:一种快速上下文基音估计模型
声音
2025-09-19 v1 计算与语言
摘要
单音音频中的基音估计(PE)对于 MIDI 转录和歌唱声音转换(SVC)至关重要,但现有方法在噪声条件下性能显著退化。在本文中,我们提出了 FCPE,一种采用 Lynx-Net 架构并利用深度可分离卷积的快速上下文基音估计模型,能够有效捕获梅尔频谱图特征,同时保持低计算成本和鲁棒的噪声容忍度。实验表明,我们的方法在 MIR-1K 数据集上实现了 96.79% 的原始基音准确率(RPA),与最先进方法持平。实时因子(RTF)在单块 RTX 4090 GPU 上为 0.0062,在效率方面显著优于现有算法。代码可在 https://github.com/CNChTu/FCPE 获取。
引用
@article{arxiv.2509.15140,
title = {FCPE: A Fast Context-based Pitch Estimation Model},
author = {Yuxin Luo and Ruoyi Zhang and Lu-Chuan Liu and Tianyu Li and Hangyu Liu},
journal= {arXiv preprint arXiv:2509.15140},
year = {2025}
}
备注
Under review