Nebula:通过建模特征提取器统计特性的基频估计与浊音检测
音频与语音处理
2018-06-07 v2 声音
摘要
提出了一种用于高质量语音分析/合成的基频(F0)与浊音状态估计算法。该问题从一种不同视角切入,即建模特征提取器在噪声下的行为,而非直接对语音信号建模。在时频局部性假设下,提取特征与目标 F0 的联合分布可通过在蒙特卡洛模拟生成的人工数据上训练一组高斯混合模型(GMM)来刻画。训练后的 GMM 可用于生成关于预测 F0 的一组条件分布,随后经维特比算法合并与后处理得到最终 F0 轨迹。在 CSTR 与 CMU Arctic 语音数据库上的评估表明,所提方法在完全合成数据上训练,取得了低于最先进方法的毛错误率。
引用
@article{arxiv.1710.11317,
title = {Nebula: F0 Estimation and Voicing Detection by Modeling the Statistical Properties of Feature Extractors},
author = {Kanru Hua},
journal= {arXiv preprint arXiv:1710.11317},
year = {2018}
}
备注
To be presented at Interspeech 2018