迭代自回归:一种改进低延迟语音增强模型的新技巧
声音
2023-12-06 v4 人工智能
音频与语音处理
摘要
流式模型是实时语音增强工具的重要组成部分。流式机制约束语音增强模型仅能使用极少的未来信息上下文。因此,低延迟流式设置通常被认为是一项具有挑战性的任务,并对模型质量产生显著的负面影响。然而,流式生成的顺序特性为自回归提供了天然的可能性,即在生成当前预测时利用先前的预测。训练自回归模型的常规方法是教师强制(teacher forcing),但其主要缺陷在于训练-推理不匹配,可能导致质量大幅下降。在本研究中,我们提出了一种简单而有效的替代技术,用于训练自回归低延迟语音增强模型。我们证明,所提出的方法在多种架构和训练场景下均能带来稳定的提升。
引用
@article{arxiv.2211.01751,
title = {Iterative autoregression: a novel trick to improve your low-latency speech enhancement model},
author = {Pavel Andreev and Nicholas Babaev and Azat Saginbaev and Ivan Shchekotov and Aibek Alanov},
journal= {arXiv preprint arXiv:2211.01751},
year = {2023}
}
备注
Accepted to Interspeech 2023