中文

FastLR:基于 Integrate-and-Fire 的非自回归唇读模型

音频与语音处理 2021-03-16 v4 计算与语言 计算机视觉与模式识别 机器学习 声音

摘要

唇读是一项令人印象深刻的技术,近年来其准确率已有明确提升。然而,现有唇读方法主要构建于自回归(AR)模型,其逐词生成目标标记并受困于高推理延迟。为突破此限制,我们提出 FastLR,一种非自回归(NAR)唇读模型,可同时生成所有目标标记。NAR 唇读是一项具有诸多困难的挑战性任务:1)源与目标间序列长度差异使得输出序列长度难以估计;2)NAR 生成的条件独立行为缺乏跨时间相关性,导致对目标分布的较差近似;3)由于缺乏有效对齐机制,编码器的特征表示能力可能较弱;4)去除 AR 语言模型加剧了唇读固有的歧义问题。因此,本文引入三种方法以缩小 FastLR 与 AR 模型间的差距:1)为应对挑战 1 和 2,我们利用 integrate-and-fire(I\&F)模块建模源视频帧与输出文本序列间的对应关系。2)为应对挑战 3,我们在编码器顶端添加辅助连接时序分类(CTC)解码器并以额外 CTC 损失优化之,同时添加辅助自回归解码器以帮助编码器特征提取。3)为克服挑战 4,我们提出一种用于 I\&F 的新颖噪声并行解码(NPD)并将字节对编码(BPE)引入唇读。我们的实验表明,与最先进唇读模型相比,FastLR 在 GRID 和 LRS2 唇读数据集上分别实现高达 10.97×\times 的加速,且 WER 绝对增加仅分别为 1.5% 和 5.5%,这证明了我们所提方法的有效性。

关键词

引用

@article{arxiv.2008.02516,
  title  = {FastLR: Non-Autoregressive Lipreading Model with Integrate-and-Fire},
  author = {Jinglin Liu and Yi Ren and Zhou Zhao and Chen Zhang and Baoxing Huai and Nicholas Jing Yuan},
  journal= {arXiv preprint arXiv:2008.02516},
  year   = {2021}
}

备注

Accepted by ACM MM 2020