中文

通过词混淆网络上下文学习实现鲁棒ASR的口语语言理解

计算与语言 2024-01-08 v1 音频与语音处理

摘要

在口语语言理解领域,通过向大型语言模型提供转录语音而非传统书面文本,已采纳了众多自然语言理解方法。在现实场景中,在输入大型语言模型之前,自动语音识别系统会生成一个输出转录假设,其中固有的错误可能会降低后续口语语言理解任务的性能。我们在此引入一种方法,利用自动语音识别系统的格状输出,而非仅依赖最佳假设,旨在捕捉语音歧义并增强口语语言理解结果。我们的上下文学习实验涵盖了口语问答和意图分类,强调了在来自格状结构的词混淆网络的帮助下,大型语言模型对含噪语音转录的鲁棒性,弥合了使用最佳自动语音识别假设与预言机理论上限之间的口语语言理解性能差距。此外,我们深入研究了大型语言模型对不同自动语音识别性能条件的鲁棒性,并仔细审视了上下文学习中被证明最具影响力的方面。

关键词

引用

@article{arxiv.2401.02921,
  title  = {Towards ASR Robust Spoken Language Understanding Through In-Context Learning With Word Confusion Networks},
  author = {Kevin Everson and Yile Gu and Huck Yang and Prashanth Gurunath Shivakumar and Guan-Ting Lin and Jari Kolehmainen and Ivan Bulyko and Ankur Gandhe and Shalini Ghosh and Wael Hamza and Hung-yi Lee and Ariya Rastrow and Andreas Stolcke},
  journal= {arXiv preprint arXiv:2401.02921},
  year   = {2024}
}

备注

Accepted to ICASSP 2024