面向连续手语识别的自强调网络
计算机视觉与模式识别
2022-12-01 v1
摘要
手部和面部在表达手语中起着重要作用,其特征通常尤其被用于提升系统性能。然而,为了有效提取手部和面部的视觉表征并捕捉其轨迹,以往方法往往伴随高计算量与增加的训练复杂度。它们通常采用额外的重型姿态估计网络来定位人体关键点,或依赖额外的预提取热图进行监督。为缓解该问题,我们提出一种自强调网络(SEN),以自驱动的方式强调信息性空间区域,仅需极少额外计算且无需额外昂贵监督。具体而言,SEN首先采用轻量子网络融合局部时空特征以识别信息性区域,随后通过注意力图动态增强原始特征。我们还观察到并非所有帧对识别的贡献均等,为此提出时间自强调模块,自适应地强调具有判别力的帧并抑制冗余帧。与以往采用手部和面部特征的方法进行全面对比,证明了我们方法的优越性,尽管那些方法常需巨大计算量并依赖昂贵的额外监督。值得注意的是,在极少额外计算下,SEN在PHOENIX14、PHOENIX14-T、CSL-Daily和CSL四个大规模数据集上取得了新的SOTA精度。可视化验证了SEN在强调信息性时空特征上的效果。代码见 https://github.com/hulianyuyy/SEN_CSLR
引用
@article{arxiv.2211.17081,
title = {Self-Emphasizing Network for Continuous Sign Language Recognition},
author = {Lianyu Hu and Liqing Gao and Zekang liu and Wei Feng},
journal= {arXiv preprint arXiv:2211.17081},
year = {2022}
}
备注
AAAI2023,Code is available at https://github.com/hulianyuyy/SEN_CSLR