深度唇语识别的进展与挑战
计算机视觉与模式识别
2021-10-18 v1
摘要
受深度学习技术与大规模数据集的推动,近年来自动唇语识别经历了范式转变。尽管视觉语音识别(VSR)的主要推力在于提升音频语音识别系统的准确率,但其在生物特征识别等其他潜在应用以及VSR系统所承诺的增益,已促使人们在唇语识别技术开发上投入大量努力。本文对基于深度学习的最先进VSR研究进行了全面综述,重点关注数据挑战、任务特有的复杂性以及相应的解决方案。这些方向的进展将加速无声语音接口从理论走向实践的转化。我们还讨论了VSR流水线的主要模块和具有影响力的数据集。最后,我们介绍了一些典型的VSR应用关切、面向真实场景的障碍以及未来的研究方向。
引用
@article{arxiv.2110.07879,
title = {Advances and Challenges in Deep Lip Reading},
author = {Marzieh Oghbaie and Arian Sabaghi and Kooshan Hashemifard and Mohammad Akbari},
journal= {arXiv preprint arXiv:2110.07879},
year = {2021}
}