SimulLR:具有注意力引导自适应记忆的同步唇读转导器
计算机视觉与模式识别
2021-09-01 v1 计算与语言
摘要
唇读旨在根据给定唇部运动视频而不依赖音频流来识别口语句子,因其在多种场景中的应用而引起了极大兴趣。尽管先前探索唇读的工作已取得显著成就,但它们均以非同步方式训练,即生成预测需要访问完整视频。为突破此限制,我们研究了同步唇读任务并设计了 SimulLR,一种具有注意力引导自适应记忆的同步唇读转导器,从三个方面展开:(1)为应对单调对齐挑战,同时考虑同步设定下生成句子的句法结构,我们构建了基于转导器的模型,并设计了若干有效训练策略,包括 CTC 预训练、模型预热和课程学习,以促进唇读转导器的训练。(2)为同步编码器学习更好的时空表示,我们构建了截断 3D 卷积和时限自注意力层,以在包含固定帧数的视频段内执行帧到帧交互。(3)由于实时场景中的存储限制,历史信息总是受限,尤其对于海量视频数据。因此,我们设计了一种新颖的注意力引导自适应记忆,以组织历史片段的语义信息,并以可接受的计算感知延迟增强视觉表示。实验表明,与最先进的非同步方法相比,SimulLR 实现了 9.10 的翻译加速,并取得了具有竞争力的结果,这表明了我们提出方法的有效性。
引用
@article{arxiv.2108.13630,
title = {SimulLR: Simultaneous Lip Reading Transducer with Attention-Guided Adaptive Memory},
author = {Zhijie Lin and Zhou Zhao and Haoyuan Li and Jinglin Liu and Meng Zhang and Xingshan Zeng and Xiaofei He},
journal= {arXiv preprint arXiv:2108.13630},
year = {2021}
}
备注
ACMMM 2021