中文

基于混合 CTC/注意力架构的视听语音识别

计算机视觉与模式识别 2018-10-02 v1

摘要

近期语音识别工作依赖于连接时序分类(CTC)或序列到序列模型进行字符级识别。CTC 假设各字符条件独立,而基于注意力的模型可提供非顺序对齐。因此,我们可以将 CTC 损失与基于注意力的模型结合,以强制单调对齐,同时摆脱条件独立假设。本文中,我们使用新近提出的混合 CTC/注意力架构对真实场景中的语音进行视听识别。据我们所知,这是此类混合架构首次用于视听语音识别。我们使用 LRS2 数据库,表明所提视听模型相较纯音频模型在词错误率上绝对降低 1.3%,并在 LRS2 数据库上取得新的 SOTA 性能(7% 词错误率)。我们还观察到,随着信噪比下降,对于若干不同类型噪声,视听模型显著优于基于音频的模型(词错误率绝对提升高达 32.9%)。

关键词

引用

@article{arxiv.1810.00108,
  title  = {Audio-Visual Speech Recognition With A Hybrid CTC/Attention Architecture},
  author = {Stavros Petridis and Themos Stafylakis and Pingchuan Ma and Georgios Tzimiropoulos and Maja Pantic},
  journal= {arXiv preprint arXiv:1810.00108},
  year   = {2018}
}

备注

Accepted to IEEE SLT 2018