中文

有意聆听:利用音频到意图前端改进语音识别

音频与语音处理 2022-02-22 v2 计算与语言 声音

摘要

理解话语的整体意图有助于听者识别所说的单个词。受此事实启发,我们开展了一项新颖研究,考察显式地将意图表示作为附加信息以改进基于循环神经网络换能器(RNN-T)的自动语音识别(ASR)系统的影响。音频到意图(A2I)模型以嵌入或后验概率的形式对话语意图进行编码,并将其用作 RNN-T 训练和推理的辅助输入。在一个 5 万小时远场英文语音语料库上实验,本研究表明:当系统以非流式模式运行时,意图表示从整个话语中提取并用于从开始偏置流式 RNN-T 搜索,其带来了 5.56% 的相对词错误率降低(WERR);另一方面,使用逐帧意图后验概率作为 RNN-T ASR 系统额外输入的流式系统产生了 3.33% 的相对 WERR。对流式系统的进一步详细分析表明,我们提出的方法在媒体播放相关意图上收益尤其好(例如 PlayMusicIntent 上 9.12% 的相对 WERR)。

关键词

引用

@article{arxiv.2105.07071,
  title  = {Listen with Intent: Improving Speech Recognition with Audio-to-Intent Front-End},
  author = {Swayambhu Nath Ray and Minhua Wu and Anirudh Raju and Pegah Ghahremani and Raghavendra Bilgi and Milind Rao and Harish Arsikere and Ariya Rastrow and Andreas Stolcke and Jasha Droppo},
  journal= {arXiv preprint arXiv:2105.07071},
  year   = {2022}
}

备注

To appear in Interspeech 2021