中文

使用Confusion2Vec的语音意图检测

计算与语言 2019-10-24 v3 声音 音频与语音处理

摘要

解码说话人意图是口语理解(SLU)的关键部分。在现实场景中,文本转录中的噪声或错误使得任务更具挑战性。本文针对自动语音识别(ASR)系统带来的噪声条件下的口语意图检测问题。我们提出使用confusion2vec词特征表示来补偿ASR产生的错误,并提高SLU系统的鲁棒性。Confusion2vec受人类语音产生和感知的启发,除了人类语言中词语的语义和句法关系外,还建模了词语之间的声学关系。我们假设ASR经常犯与声学相似词语相关的错误,而confusion2vec具有词语间声学关系的内在模型,能够补偿这些错误。通过在ATIS基准数据集上的实验,我们证明了所提模型在噪声ASR条件下的鲁棒性,并取得了最先进的结果。与之前的最先进方法相比,我们的系统将分类错误率(CER)降低了20.84%,并将鲁棒性提高了37.48%(更低的CER退化),从干净转录到噪声转录。在噪声转录上训练意图检测模型也展示了改进。

关键词

引用

@article{arxiv.1904.03576,
  title  = {Spoken Language Intent Detection using Confusion2Vec},
  author = {Prashanth Gurunath Shivakumar and Mu Yang and Panayiotis Georgiou},
  journal= {arXiv preprint arXiv:1904.03576},
  year   = {2019}
}