使用时间卷积网络进行唇读
计算机视觉与模式识别
2020-01-24 v1 声音
音频与语音处理
摘要
得益于深度学习的进展,唇读近来吸引了大量研究关注。当前用于真实场景下孤立词识别的最优模型由残差网络与双向门控循环单元(BGRU)层组成。本工作中,我们针对该模型的局限性提出了进一步改善其性能的改动。首先,将 BGRU 层替换为时间卷积网络(TCN)。其次,我们大幅简化了训练流程,从而可在单一阶段训练模型。第三,我们指出当前最优方法产生的模型对序列长度变化泛化不佳,并通过提出变长增强来解决该问题。我们在最大的公开英语与普通话孤立词识别数据集 LRW 与 LRW1000 上给出结果。我们所提模型在这两个数据集上分别取得 1.2% 与 3.2% 的绝对提升,达到了新的最优性能。
引用
@article{arxiv.2001.08702,
title = {Lipreading using Temporal Convolutional Networks},
author = {Brais Martinez and Pingchuan Ma and Stavros Petridis and Maja Pantic},
journal= {arXiv preprint arXiv:2001.08702},
year = {2020}
}