中文

轻松学习有效的唇读模型

计算机视觉与模式识别 2020-11-17 v1

摘要

唇读,又称视觉语音识别,旨在通过分析唇部动态从视频中识别语音内容。近年来,受益于快速发展的深度学习技术以及近期大规模唇读数据集,该领域取得了若干令人瞩目的进展。大多数现有方法通过构建复杂的神经网络,配合若干定制化的训练策略来获得高性能,而这些策略往往仅以非常简略的描述给出,甚至仅在源代码中体现。我们发现,恰当利用这些策略总能在不大幅改动模型的情况下带来显著的性能提升。考虑到这些策略不可忽视的作用以及当前训练有效唇读模型所面临的困难现状,我们首次开展了全面的定量研究与对比分析,以揭示若干不同选择对唇读的影响。仅通过对基线流程引入一些易于实现的改进,我们在两个最大的公开唇读数据集 LRW 和 LRW-1000 上分别将性能从 83.7% 和 38.2% 明显提升至 88.4% 和 55.7%。这些结果可与现有 SOTA 结果相媲美,甚至有所超越。

关键词

引用

@article{arxiv.2011.07557,
  title  = {Learn an Effective Lip Reading Model without Pains},
  author = {Dalu Feng and Shuang Yang and Shiguang Shan and Xilin Chen},
  journal= {arXiv preprint arXiv:2011.07557},
  year   = {2020}
}