基于CNN的唇部状态检测建模用于非语言通信
计算机视觉与模式识别
2022-01-19 v2
摘要
基于视觉的深度学习模型在听障及秘密通信方面具有广阔前景。虽然此类非语言通信主要通过手势和面部表情进行研究,但迄今为止尚无针对基于唇部状态(即张开/闭合)的解读/翻译系统的研究探索。为支持这一发展,本文报告了两种用于唇部状态检测的新型卷积神经网络(CNN)模型。基于两个著名的唇部特征点检测器DLIB和MediaPipe,我们通过一组六个关键特征点简化了唇部状态模型,并利用它们之间的距离进行唇部状态分类。由此,两种模型均被开发用于计数唇部的张开与闭合,从而能够通过总计数来分类一个符号。我们研究了不同帧率、唇部运动和面部角度,以确定模型的有效性。我们的早期实验结果表明,基于DLIB的模型相对较慢,平均每秒6帧(FPS),平均检测准确率较高,为95.25%。相比之下,基于MediaPipe的模型提供了更快的特征点检测能力,平均FPS为20,检测准确率为94.4%。因此,两种模型都能有效地将用于非语言语义的唇部状态解读为自然语言。
引用
@article{arxiv.2112.04752,
title = {Modelling Lips-State Detection Using CNN for Non-Verbal Communications},
author = {Abtahi Ishmam and Mahmudul Hasan and Md. Saif Hassan Onim and Koushik Roy and Md. Akiful Haque Akif and Hussain Nyeem},
journal= {arXiv preprint arXiv:2112.04752},
year = {2022}
}