谐波来拯救:为何有声语音并非宽态-stationary过程
音频与语音处理
2025-07-15 v1 信号处理
摘要
语音处理算法通常依赖于对底层过程的统计知识。尽管已为此进行多年研究,但关于语音最合适统计模型的争论仍在继续。语音常被建模为宽态-stationary(WSS)过程。然而,WSS模型用于谱相关过程是根本错误的,因为WSS意味着谱无相关性。本文证明,有声语音可更准确地表示为循环宽态-stationary(CS)过程。通过对 inherently 跨频率相关的过程采用CS模型而非WSS模型,可改进交叉功率谱密度(PSD)估计、源分离和波束成形。我们展示了如何利用CS过程的谐波频率间相关性来增强系统识别,并通过仿真和真实语音数据验证了我们的发现。
引用
@article{arxiv.2507.10176,
title = {Harmonics to the Rescue: Why Voiced Speech is Not a Wss Process},
author = {Giovanni Bologni and Richard Heusdens and Richard C. Hendriks},
journal= {arXiv preprint arXiv:2507.10176},
year = {2025}
}
备注
Comments: Accepted at the 2024 International Workshop on Acoustic Signal Enhancement (IWAENC 2024)