中文

通过噪声表示学习增强对话语音识别的鲁棒上下文感知

计算与语言 2024-08-13 v1 声音 音频与语音处理

摘要

最近的对话系统依赖基于回合的口语交互,要求准确的自动语音识别(ASR)。ASR中的错误会显著影响下游对话任务。为解决这一问题,已有研究提出利用用户与代理之间的对话上下文来转录后续语句。该方法将用户的语音转录和代理的回复作为模型输入,使用每个回合生成的累积上下文。然而,由于ASR模型以自回归方式生成上下文,该上下文容易受到ASR错误的影响。这种噪声上下文会进一步削弱上下文输入带来的好处,导致次优的ASR性能。本文提出上下文噪声表示学习(Context Noise Representation Learning, CNRL)来增强对噪声上下文的鲁棒性,最终提升对话语音识别准确率。为最大化上下文感知的优势,本方法包括使用基于文本的对话数据进行解码器预训练,以及为上下文编码器进行噪声表示学习。基于语音对话的评估结果表明,本方法相比基线方法具有优越表现。此外,本方法的优势在噪声环境中尤为突出,在该环境中用户语音因真实世界噪声而几乎不可闻,依赖上下文信息准确转录输入。

关键词

引用

@article{arxiv.2408.06043,
  title  = {Enhancing Dialogue Speech Recognition with Robust Contextual Awareness via Noise Representation Learning},
  author = {Wonjun Lee and San Kim and Gary Geunbae Lee},
  journal= {arXiv preprint arXiv:2408.06043},
  year   = {2024}
}

备注

11 pages, 2 figures, Accepted to SIGDIAL2024