中文

迭代自回归:一种改进低延迟语音增强模型的新技巧

声音 2023-12-06 v4 人工智能 音频与语音处理

摘要

流式模型是实时语音增强工具的重要组成部分。流式机制约束语音增强模型仅能使用极少的未来信息上下文。因此,低延迟流式设置通常被认为是一项具有挑战性的任务,并对模型质量产生显著的负面影响。然而,流式生成的顺序特性为自回归提供了天然的可能性,即在生成当前预测时利用先前的预测。训练自回归模型的常规方法是教师强制(teacher forcing),但其主要缺陷在于训练-推理不匹配,可能导致质量大幅下降。在本研究中,我们提出了一种简单而有效的替代技术,用于训练自回归低延迟语音增强模型。我们证明,所提出的方法在多种架构和训练场景下均能带来稳定的提升。

关键词

引用

@article{arxiv.2211.01751,
  title  = {Iterative autoregression: a novel trick to improve your low-latency speech enhancement model},
  author = {Pavel Andreev and Nicholas Babaev and Azat Saginbaev and Ivan Shchekotov and Aibek Alanov},
  journal= {arXiv preprint arXiv:2211.01751},
  year   = {2023}
}

备注

Accepted to Interspeech 2023