中文

通过部分假设选择实现低延迟序列到序列语音识别与翻译

计算与语言 2020-10-14 v2 声音 音频与语音处理

摘要

编码器-解码器模型为语音识别和翻译等序列到序列任务提供了通用架构。虽然离线系统通常在词错率 (WER) 和 BLEU 等质量指标上进行评估,但在许多实际应用场景中,延迟也是一个关键因素。我们提出了三种用于基于分块的增量推理的延迟降低技术,并从准确率与延迟的权衡角度评估了它们的效率。在 300 小时的 How2 数据集上,与离线转录相比,我们牺牲了 1% 的 WER(6% 相对值),将延迟降低了 83% 至 0.8 秒。尽管我们的实验使用的是 Transformer,但假设选择策略也适用于其他编码器-解码器模型。为了避免昂贵的重复计算,我们使用了单向注意力编码器。在对部分序列进行适应过程后,单向模型的性能与原始模型相当。我们进一步表明,我们的方法也适用于低延迟语音翻译。在 How2 英语-葡萄牙语语音翻译中,与离线系统相比,我们将延迟降低至 0.7 秒(-84% 相对值),同时产生了 2.4 个 BLEU 点(5% 相对值)的损失。

关键词

引用

@article{arxiv.2005.11185,
  title  = {Low-Latency Sequence-to-Sequence Speech Recognition and Translation by Partial Hypothesis Selection},
  author = {Danni Liu and Gerasimos Spanakis and Jan Niehues},
  journal= {arXiv preprint arXiv:2005.11185},
  year   = {2020}
}

备注

Interspeech 2020