中文

基于注意力迁移的序列到序列学习用于增量语音识别

计算与语言 2020-11-05 v1 声音 音频与语音处理

摘要

基于注意力的序列到序列自动语音识别(ASR)需要显著延迟才能识别长 utterance,因为输出是在接收完整输入序列后生成的。尽管近期若干研究提出了用于增量语音识别(ISR)的序列机制,但使用不同框架与学习算法比标准 ASR 模型更为复杂。一个主要原因是模型需要决定增量步长并学习与当前短语音段对齐的转写。本工作中,我们研究是否可通过将整句 ASR 作为教师模型、ISR 作为学生模型,来将基于注意力的 ASR 原始架构用于 ISR 任务。我们设计了一种替代学生网络:不采用更窄或更浅的模型,而是保持教师模型的原始架构但使用更短序列(少量编码器与解码器状态)。利用注意力迁移,学生网络学习模仿当前输入短语音段与转写之间相同的对齐。实验表明,通过将识别过程起始时间延迟约 1.7 秒,我们可获得与需等待结束才能识别相当的性能。

关键词

引用

@article{arxiv.2011.02127,
  title  = {Sequence-to-Sequence Learning via Attention Transfer for Incremental Speech Recognition},
  author = {Sashi Novitasari and Andros Tjandra and Sakriani Sakti and Satoshi Nakamura},
  journal= {arXiv preprint arXiv:2011.02127},
  year   = {2020}
}

备注

Accepted in INTERSPEECH 2019