中文

基于声学标记的自回归语音增强

声音 2025-07-18 v1 机器学习 音频与语音处理

摘要

在语音处理管道中,提高实际录音的质量和可理解性至关重要。虽然监督回归是语音增强的主要方法,但音频标记正在成为与其他模态集成的有前景的替代方法。然而,使用离散表示进行语音增强的研究仍有限。以往的工作主要关注语义标记,这些标记倾向于丢弃关键声学细节,如说话者身份。此外,这些研究通常采用非自回归模型,假设输出在条件下相互独立,忽视了自回归建模所带来的潜在改进。为此,我们:1) 全面研究了声学标记用于语音增强的性能,包括比特率和噪声强度的影响;2) 引入一种 novel transducer-based 自回归架构,专为此任务设计。在 VoiceBank 和 Libri1Mix 数据集上的实验表明,声学标记在保留说话者身份方面优于语义标记,而我们的自回归方法还能进一步提升性能。尽管如此,我们仍注意到离散表示在与连续表示相比方面仍有不足,这凸显了该领域进一步研究的必要性。

关键词

引用

@article{arxiv.2507.12825,
  title  = {Autoregressive Speech Enhancement via Acoustic Tokens},
  author = {Luca Della Libera and Cem Subakan and Mirco Ravanelli},
  journal= {arXiv preprint arXiv:2507.12825},
  year   = {2025}
}

备注

5 pages, 2 figures