中文

面向鲁棒端到端口语理解的模态置信度感知训练

计算与语言 2023-07-25 v1 声音 音频与语音处理

摘要

从语音生成语义解析的端到端(E2E)口语理解(SLU)系统近年来变得更有前景。该方法使用单一模型,利用来自预训练语音识别模型(ASR)的音频和文本表示,并在设备端流式场景中优于传统的流水线 SLU 系统。然而,当由于 ASR 转写错误导致文本表示质量较低时,E2E SLU 系统仍表现出弱点。为克服此问题,我们提出了一种新颖的 E2E SLU 系统,其通过基于 ASR 假设估计的模态置信度融合音频和文本表示,增强对 ASR 错误的鲁棒性。我们引入了两种新技术:1)一种编码 ASR 假设质量的有效方法;2)一种将其整合进 E2E SLU 模型的有效途径。我们在 STOP 数据集上展示了准确率的提升,并分享分析以证明我们方法的有效性。

关键词

引用

@article{arxiv.2307.12134,
  title  = {Modality Confidence Aware Training for Robust End-to-End Spoken Language Understanding},
  author = {Suyoun Kim and Akshat Shrivastava and Duc Le and Ju Lin and Ozlem Kalinli and Michael L. Seltzer},
  journal= {arXiv preprint arXiv:2307.12134},
  year   = {2023}
}

备注

INTERSPEECH 2023