基于时序超分辨率网络的连续手语识别
计算机视觉与模式识别
2022-07-05 v1
摘要
针对基于深度学习的时空层次连续手语识别模型计算量大、限制模型实时应用的问题,本文提出一种时序超分辨率网络(TSRNet)。将数据重构成稠密特征序列,在降低整体模型计算量的同时将最终识别精度损失降至最低。基于 TSRNet 的连续手语识别模型(CSLR)主要由三部分组成:帧级特征提取、时序特征提取与 TSRNet,其中 TSRNet 位于帧级特征提取与时序特征提取之间,主要包括细节描述子与粗略描述子两个分支。稀疏帧级特征通过两个设计分支所得特征进行融合,作为重构的稠密帧级特征序列,并在时序特征提取部分之后使用连接时序分类(CTC)损失进行训练与优化。为更好地恢复语义级信息,整体模型采用本文提出的自生成对抗训练方法进行训练以降低模型错误率。该训练方法将 TSRNet 视为生成器,将帧级处理部分与时序处理部分视为判别器。此外,为统一不同基准下模型精度损失的评价标准,本文提出词错误率偏差(WERD),其以重构帧级特征序列与完整原始帧级特征序列所得的估计词错误率(WER)与参考 WER 之间的误差率作为 WERD。在两个大规模手语数据集上的实验证明了所提模型的有效性。
引用
@article{arxiv.2207.00928,
title = {Continuous Sign Language Recognition via Temporal Super-Resolution Network},
author = {Qidan Zhu and Jing Li and Fei Yuan and Quan Gan},
journal= {arXiv preprint arXiv:2207.00928},
year = {2022}
}
备注
13 pages, 11 figures