通过利用 ASR N-best 假设改进口语理解
计算与语言
2020-01-16 v1 声音
音频与语音处理
摘要
在现代口语理解(SLU)系统中,自然语言理解(NLU)模块将自动语音识别(ASR)模块对语音的识别结果作为下游任务的输入。NLU 模块通常在域分类和意图分类等下游任务中使用给定语音的第一最佳识别结果。然而,ASR 模块可能误识某些语音,且第一最佳识别结果可能有误且含噪。仅依赖第一最佳识别结果会使下游任务的性能非最优。为解决此问题,我们引入了一系列简单而高效的模型,通过共同利用 ASR 模块的 n-best 语音识别结果来改进对输入语音语义的理解。
引用
@article{arxiv.2001.05284,
title = {Improving Spoken Language Understanding By Exploiting ASR N-best Hypotheses},
author = {Mingda Li and Weitong Ruan and Xinyue Liu and Luca Soldaini and Wael Hamza and Chengwei Su},
journal= {arXiv preprint arXiv:2001.05284},
year = {2020}
}
备注
Submitted to ICASSP 2020. Have signed an e-copyright agreement with the IEEE during ICASSP 2020 submission