中文

混合语音输入下基于注意力机制的神经自动语音识别性能评估

声音 2021-08-04 v1 计算与语言 音频与语音处理

摘要

为了评估基于注意力机制的神经自动语音识别(ASR)在噪声条件下的性能,当前的趋势是向模型提供数小时的各种噪声语音数据,并测量整体的词/音素错误率(W/PER)。总的来说,目前尚不清楚这些模型在暴露于两个或更多说话者同时活跃的鸡尾酒会场景时表现如何。在本文中,我们以不同的目标干扰比(TIR)向一种流行的基于注意力机制的神经 ASR 模型,即 Listen, Attend, and Spell (LAS),提供混合语音信号,并测量其音素错误率。我们特别详细研究了当两个音素混合时,模型会预测出哪个音素;通过这种方式,我们构建了一个模型,该模型给出了一个音素最可能的预测。我们发现,当 LAS 在 TIR = 0 dB 下处理混合语音信号时,PER 相对增加了 65%,而在 TIR = 30 dB 时,性能接近非混合场景。我们的结果表明,当模型接收到混合音素信号时,倾向于预测那些在原始音素信号评估中具有更高准确率的音素。

关键词

引用

@article{arxiv.2108.01245,
  title  = {The Performance Evaluation of Attention-Based Neural ASR under Mixed Speech Input},
  author = {Bradley He and Martin Radfar},
  journal= {arXiv preprint arXiv:2108.01245},
  year   = {2021}
}

备注

5 pages, 3 figures