听唇:通过蒸馏语音识别器改进唇读
计算机视觉与模式识别
2019-11-27 v1 机器学习
音频与语音处理
摘要
近年来,得益于深度学习和大规模数据集的可用性,唇读取得了空前的发展。尽管取得了令人鼓舞的成果,唇读的性能仍不幸劣于其对应物语音识别,这归因于其动作本身的模糊性,使得从唇动视频中提取判别特征颇具挑战。本文中,我们提出一种称为 Lip by Speech (LIBS) 的新方法,其目标是通过向语音识别器学习来强化唇读。我们方法背后的原理是,从语音识别器提取的特征可能提供互补且具判别性的线索,这些线索难以从细微的唇部运动中获取,从而助力唇读器的训练。具体而言,这是通过将多粒度知识从语音识别器蒸馏到唇读器来实现的。为进行这一跨模态知识蒸馏,我们采用高效的对齐方案来处理音频与视频长度不一致的问题,并采用创新的过滤策略来精炼语音识别器的预测。所提方法在 CMLR 和 LRS2 数据集上达到了新的最先进性能,在字符错误率上分别比基线高出 7.66% 和 2.75%。
引用
@article{arxiv.1911.11502,
title = {Hearing Lips: Improving Lip Reading by Distilling Speech Recognizers},
author = {Ya Zhao and Rui Xu and Xinchao Wang and Peng Hou and Haihong Tang and Mingli Song},
journal= {arXiv preprint arXiv:1911.11502},
year = {2019}
}
备注
AAAI 2020