基于混合 CTC/注意力架构的视听语音识别
计算机视觉与模式识别
2018-10-02 v1
摘要
近期语音识别工作依赖于连接时序分类(CTC)或序列到序列模型进行字符级识别。CTC 假设各字符条件独立,而基于注意力的模型可提供非顺序对齐。因此,我们可以将 CTC 损失与基于注意力的模型结合,以强制单调对齐,同时摆脱条件独立假设。本文中,我们使用新近提出的混合 CTC/注意力架构对真实场景中的语音进行视听识别。据我们所知,这是此类混合架构首次用于视听语音识别。我们使用 LRS2 数据库,表明所提视听模型相较纯音频模型在词错误率上绝对降低 1.3%,并在 LRS2 数据库上取得新的 SOTA 性能(7% 词错误率)。我们还观察到,随着信噪比下降,对于若干不同类型噪声,视听模型显著优于基于音频的模型(词错误率绝对提升高达 32.9%)。
引用
@article{arxiv.1810.00108,
title = {Audio-Visual Speech Recognition With A Hybrid CTC/Attention Architecture},
author = {Stavros Petridis and Themos Stafylakis and Pingchuan Ma and Georgios Tzimiropoulos and Maja Pantic},
journal= {arXiv preprint arXiv:1810.00108},
year = {2018}
}
备注
Accepted to IEEE SLT 2018