面向实用的唇读:基于蒸馏与高效模型的探索
计算机视觉与模式识别
2021-06-03 v3 机器学习
摘要
得益于神经网络的复兴,唇读取得了诸多进展。近期工作侧重于通过寻找最优架构或提升泛化能力来改善性能等方面。然而,当前方法论与在实际场景中有效部署唇读的需求之间仍存在显著差距。在本工作中,我们提出一系列创新以显著缩小该差距:首先,我们利用自蒸馏将 LRW 和 LRW-1000 上的最优性能大幅提升至 respectively 88.5% 和 46.6%。其次,我们提出一系列架构改动,包括一种新颖的逐深度可分离时序卷积网络(DS-TCN)头,将计算成本削减至(已相当高效的)原始模型的一小部分。第三,我们表明知识蒸馏是恢复轻量模型性能的一种非常有效的工具。这产生了一系列具有不同精度-效率权衡的模型。然而,我们最有前景的轻量模型与当前最优性能相当,同时计算和参数量分别减少 8.2 倍和 3.9 倍,我们希望这将有助于唇读模型在实际应用中的部署。
引用
@article{arxiv.2007.06504,
title = {Towards Practical Lipreading with Distilled and Efficient Models},
author = {Pingchuan Ma and Brais Martinez and Stavros Petridis and Maja Pantic},
journal= {arXiv preprint arXiv:2007.06504},
year = {2021}
}
备注
Accepted to ICASSP 2021