用于视频唇读中的嘴唇定位技术研究
计算机视觉与模式识别
2020-09-29 v1 机器学习
图像与视频处理
摘要
本文讨论并比较了若干用于从人脸中定位嘴唇的不同技术及其处理步骤。唇定位是从视频输入中提取视觉信息以进行唇读的基本步骤。这些技术可应用于不对称嘴唇以及露齿、露舌和有胡须的嘴部。在唇读过程中通常使用以下步骤:首先在视频输入的首帧中定位嘴唇,然后利用初始步骤得到的像素点跟踪后续帧中的嘴唇,最后将跟踪到的唇模型转换为其对应匹配字母以给出视觉信息。基于所讨论的技术还提出了一项新方案。唇读在音频缺失或较弱(无论通信系统中是否有噪声)时的自动语音识别中有用。人机通信也将需要语音识别。
引用
@article{arxiv.2009.13420,
title = {A Study on Lip Localization Techniques used for Lip reading from a Video},
author = {S. D. Lalitha and K. K. Thyagharajan},
journal= {arXiv preprint arXiv:2009.13420},
year = {2020}
}
备注
6 pages, 1 figure