中文

利用线性预测方法精炼基于深度学习的共振峰追踪器

音频与语音处理 2023-08-21 v1 人工智能 机器学习 声音 信号处理

摘要

本研究通过使用以模型驱动方式由基于线性预测(LP)的方法估计的共振峰,对已有数据驱动追踪器 DeepFormants 追踪到的共振峰进行精炼,从而研究共振峰追踪。作为基于 LP 的共振峰估计方法,采用了传统的协方差分析(LP-COV)和近期提出的准闭相前后向(QCP-FB)分析。在所提出的精炼方法中,首先由数据驱动的 DeepFormants 追踪器预测三个最低共振峰的轮廓,然后逐帧用基于模型的 LP 方法所示局部谱峰替换预测的共振峰。该精炼过程可插入 DeepFormants 追踪器,无需任何新数据学习。使用流行的声道共振(VTR)语料库,将两个精炼的 DeepFormants 追踪器与原始 DeepFormants 及五种已知传统追踪器进行比较。结果表明,数据驱动的 DeepFormants 追踪器优于传统追踪器,且利用 QCP-FB 分析精炼 DeepFormants 预测的共振峰获得了最佳性能。此外,通过对被加性噪声污染的 VTR 语音进行共振峰追踪,研究表明精炼的 DeepFormants 追踪器比参考追踪器对噪声更具鲁棒性。总体而言,这些结果表明,传统上用于共振峰估计的基于 LP 的模型驱动方法,可与现代数据驱动追踪器轻松结合而无需进一步训练,以提升追踪器性能。

关键词

引用

@article{arxiv.2308.09051,
  title  = {Refining a Deep Learning-based Formant Tracker using Linear Prediction Methods},
  author = {Paavo Alku and Sudarsana Reddy Kadiri and Dhananjaya Gowda},
  journal= {arXiv preprint arXiv:2308.09051},
  year   = {2023}
}

备注

Computer Speech and Language, Vol. 81, Article 101515, June 2023