基于跨分辨率知识蒸馏的连续手语识别
计算机视觉与模式识别
2023-03-14 v1
摘要
连续手语识别(CSLR)研究的目标是将 CSLR 模型作为现实生活中的交流工具,模型的实时性要求十分重要。本文中,我们通过跨分辨率知识蒸馏解决模型实时性问题。在我们的研究中发现,保持学生网络与教师网络输出的帧级特征尺度一致,优于为特征蒸馏恢复帧级特征尺寸。基于该发现,我们提出一种新的帧级特征提取器,使输出的帧级特征与教师网络输出保持相同尺度。我们进一步结合先前研究提出的 TSCM+2D 混合卷积,构成一种新的轻量级端到端 CSLR 网络——低分辨率输入网络(LRINet)。随后将其用于结合跨分辨率知识蒸馏与传统知识蒸馏方法,形成基于跨分辨率知识蒸馏(CRKD)的 CSLR 模型。CRKD 使用高分辨率帧作为教师网络输入进行训练,训练后锁定权重,然后使用低分辨率帧作为学生网络 LRINet 的输入,分别对帧级特征与分类特征进行知识蒸馏。在两个大规模连续手语数据集上的实验证明了 CRKD 的有效性。与以高分辨率数据作为输入的模型相比,在相同实验条件下,模型的计算量、参数量与推理时间显著减少,同时保证了模型精度,并与其他先进方法比较取得了极具竞争力的结果。
引用
@article{arxiv.2303.06820,
title = {Continuous sign language recognition based on cross-resolution knowledge distillation},
author = {Qidan Zhu and Jing Li and Fei Yuan and Quan Gan},
journal= {arXiv preprint arXiv:2303.06820},
year = {2023}
}
备注
11 pages, 7 figures