中文

基于外部视位解码的唇读

计算机视觉与模式识别 2021-11-09 v2

摘要

唇读是从唇部运动中识别语音的操作。这是一项困难的任务,因为某些词发音时的嘴唇运动彼此相似。视位(viseme)用于描述对话过程中的唇部运动。本文旨在展示如何通过将视频到字符分为两个阶段来利用外部文本数据(用于视位到字符的映射),即先将视频转换为视位,然后使用独立的模型将视位转换为字符。我们提出的方法在 BBC-Oxford Lip Reading Sentences 2 (LRS2) 数据集上相比普通的序列到序列唇读模型将词错误率降低了 4%。

关键词

引用

@article{arxiv.2104.04784,
  title  = {Lip reading using external viseme decoding},
  author = {Javad Peymanfard and Mohammad Reza Mohammadi and Hossein Zeinali and Nasser Mozayani},
  journal= {arXiv preprint arXiv:2104.04784},
  year   = {2021}
}