中文

持续语音短期预测的最大预测增益分析

声音 2026-01-15 v1

摘要

信号预测被广泛应用于经济预测、回声消除和数据压缩等领域,特别是语音和音乐的预测编码。预测编码算法通过信号预测来降低数据传输或存储所需的比特率。预测增益是应用信号编码中衡量预测器质量的经典指标,因为它将均方预测误差与预测编码器的量化信噪比联系起来。为了评估预测器模型,了解独立于预测器模型的最大可达预测增益是理想的。在本文中,我们应用Nadaraya-Watson核回归(NWKR)和信息论上界,在一个新录制的持续语音/音素数据集上分析预测增益的上界。研究发现,对于清音,线性预测器始终能在最多0.3 dB的误差范围内达到最大预测增益。对于浊音,最优单抽头预测器被发现是线性的,但从两个抽头开始,最大可达预测增益比线性预测器的预测增益高出约2 dB至6 dB。此外,观察到了说话人/受试者之间的显著差异。所创建的数据集及代码可应研究请求获取。

关键词

引用

@article{arxiv.2601.09461,
  title  = {Analysis of the Maximum Prediction Gain of Short-Term Prediction on Sustained Speech},
  author = {Reemt Hinrichs and Muhamad Fadli Damara and Stephan Preihs and Jörn Ostermann},
  journal= {arXiv preprint arXiv:2601.09461},
  year   = {2026}
}

备注

Rejected at Eurasip for practical irrelevancy. Submitted here for reference. Originally accepted at DCC 2020 (Poster) but withdrawn due to page count limit