面向鲁棒端到端口语理解的模态置信度感知训练
计算与语言
2023-07-25 v1 声音
音频与语音处理
摘要
从语音生成语义解析的端到端(E2E)口语理解(SLU)系统近年来变得更有前景。该方法使用单一模型,利用来自预训练语音识别模型(ASR)的音频和文本表示,并在设备端流式场景中优于传统的流水线 SLU 系统。然而,当由于 ASR 转写错误导致文本表示质量较低时,E2E SLU 系统仍表现出弱点。为克服此问题,我们提出了一种新颖的 E2E SLU 系统,其通过基于 ASR 假设估计的模态置信度融合音频和文本表示,增强对 ASR 错误的鲁棒性。我们引入了两种新技术:1)一种编码 ASR 假设质量的有效方法;2)一种将其整合进 E2E SLU 模型的有效途径。我们在 STOP 数据集上展示了准确率的提升,并分享分析以证明我们方法的有效性。
引用
@article{arxiv.2307.12134,
title = {Modality Confidence Aware Training for Robust End-to-End Spoken Language Understanding},
author = {Suyoun Kim and Akshat Shrivastava and Duc Le and Ju Lin and Ozlem Kalinli and Michael L. Seltzer},
journal= {arXiv preprint arXiv:2307.12134},
year = {2023}
}
备注
INTERSPEECH 2023