中文

面向端到端分析-合成的可微分时变线性预测

音频与语音处理 2024-10-21 v3 声音

摘要

在现代深度学习框架中,对线性预测 (LP) 算子进行端到端训练因其递归公式而速度较慢。此外,帧级逼近作为加速方法无法很好地在测试时间条件下泛化,其中 LP 按样本计算。高效的可微分样本级 LP 用于端到端训练是消除这一障碍的关键。我们将来自 GOLF 解码器的高效时不变 LP 实现推广到时变情况。结合经典的 source-filter 模型,我们展示了改进版 GOLF 能够学习 LP 系数并比其帧级版本更好地重建语音。此外,在我们的听觉测试中,GOLF 生成的输出在质量评级方面优于最新进展的可微分 WORLD 解码器。

关键词

引用

@article{arxiv.2406.05128,
  title  = {Differentiable Time-Varying Linear Prediction in the Context of End-to-End Analysis-by-Synthesis},
  author = {Chin-Yun Yu and György Fazekas},
  journal= {arXiv preprint arXiv:2406.05128},
  year   = {2024}
}

备注

Published at Interspeech 2024