用于唇读的时空注意力机制与知识蒸馏
计算机视觉与模式识别
2021-08-10 v1 人工智能
摘要
尽管音频与音视觉语音识别领域有所进展,视觉语音识别系统仍因某些音素的视觉模糊性而鲜被探索。本工作中,我们提出一种结合三项贡献的新唇读模型。首先,模型前端采用时空注意力机制以帮助从输入视觉帧中提取信息性数据。其次,模型后端利用序列级与帧级知识蒸馏(KD)技术,使得在视觉模型训练期间能利用音频数据。第三,采用包含基于面部标志点检测的唇部对齐的数据预处理流程。在 LRW 唇读数据集基准上,展示了显著的准确率提升;时空注意力、知识蒸馏与唇部对齐贡献分别达到 88.43%、88.64% 与 88.37%。
引用
@article{arxiv.2108.03543,
title = {Spatio-Temporal Attention Mechanism and Knowledge Distillation for Lip Reading},
author = {Shahd Elashmawy and Marian Ramsis and Hesham M. Eraqi and Farah Eldeshnawy and Hadeel Mabrouk and Omar Abugabal and Nourhan Sakr},
journal= {arXiv preprint arXiv:2108.03543},
year = {2021}
}