注意力语音识别模型在非域外语句上的异常行为
音频与语音处理
2020-02-13 v1 计算与语言
机器学习
声音
摘要
我们讨论了用于自动语音识别的自回归序列到序列注意力架构中的回声式转录问题,即模型在面对非域外语句时会生成非常长的重复输出序列。我们使用仅在 LibriSpeech 语料库上训练的注意力编码器-解码器模型,对来自英国国家语料库(British National Corpus)的音频进行解码。我们观察到许多 5 秒录音产生了超过 500 个字符的解码输出(即每秒超过 100 个字符)。在相同数据上训练的帧同步混合(DNN-HMM)模型则不会产生这些异常长的转录。这些解码问题在 ESPnet 的语音 transformer 模型中可复现,在自注意力 CTC 模型中程度较轻,表明这些问题源于注意力机制的使用本身。我们构建了一个独立的长度预测模型来预测输出中正确的 wordpiece 数量,从而能够识别并截断有问题的解码结果,同时不增加 LibriSpeech 任务上的词错误率。
引用
@article{arxiv.2002.05150,
title = {Attentional Speech Recognition Models Misbehave on Out-of-domain Utterances},
author = {Phillip Keung and Wei Niu and Yichao Lu and Julian Salazar and Vikas Bhardwaj},
journal= {arXiv preprint arXiv:2002.05150},
year = {2020}
}
备注
Artifacts like our filtered Audio BNC dataset can be found at https://github.com/aws-samples/seq2seq-asr-misbehaves