中文

关于语音和音频信号正弦模型参数估计的研究

音频与语音处理 2026-03-04 v1 人工智能 多媒体 信号处理

摘要

在本文中,我们考察了三种著名的语音和音频正弦模型的参数估计性能。第一种是基于快速傅里叶变换(FFT)的标准正弦模型(SM)。第二种是指数阻尼正弦模型(EDSM),该模型于过去十年中提出,利用子空间方法进行参数估计。最后是扩展自适应准谐波模型(eaQHM),该模型最近被提出用于 AM-FM 分解,并使用最小二乘法在一组适应信号局部特征的基函数上估计信号参数。简要描述了每种模型的参数估计方法,并在各种合成信号上就信号重建精度与窗口大小的关系,以及在真实信号上就正弦波数量的关系,对其性能进行了比较。后者包括高度非平稳信号,如歌唱人声和吉他独奏。通过合成信号展示了每种模型的优缺点,随后讨论了在真实信号上的应用。结论是,eaQHM 在中到大窗口尺寸分析中优于 EDS,而 EDSM 在较小分析窗口尺寸下产生更高的重建值。因此,未来的研究方向似乎是将 eaQHM 的自适应性与 EDSM 的参数估计鲁棒性相结合,形成一种用于通用音频信号高质量分析和重合成的新范式。

关键词

引用

@article{arxiv.2401.01255,
  title  = {On the Parameter Estimation of Sinusoidal Models for Speech and Audio Signals},
  author = {George P. Kafentzis},
  journal= {arXiv preprint arXiv:2401.01255},
  year   = {2026}
}