利用一致性约束与签名者去除改进连续手语识别
计算机视觉与模式识别
2024-01-12 v2
摘要
大多数基于深度学习的连续手语识别(CSLR)模型共享由视觉模块、序列模块和对齐模块组成的相似骨干网络。然而,由于训练样本有限,连接时序分类损失可能不足以充分训练此类 CSLR 骨干网络。本工作中,我们提出三项辅助任务以增强 CSLR 骨干网络。第一项任务从一致性角度增强对训练不足问题敏感的视觉模块。具体而言,由于手语信息主要包含于签名者的面部表情与手部动作中,我们开发了关键点引导的空间注意力模块,以强制视觉模块关注信息区域,即空间注意力一致性。其次,注意到视觉与序列模块的输出特征均表示同一句子,为更好发挥骨干网络能力,我们在视觉与序列模块间施加句子嵌入一致性约束,以增强两类特征的表征能力。我们将以上述辅助任务训练的 CSLR 模型命名为一致性增强 CSLR,其在训练与测试均出现所有签名者的签名者相关数据集上表现良好。为使其在签名者无关设定下更鲁棒,进一步提出基于特征解耦的签名者去除模块,以从骨干网络中移除签名者信息。我们进行了充分的消融实验以验证这些辅助任务的有效性。更值得注意的是,基于 transformer 骨干网络,我们的模型在 PHOENIX-2014、PHOENIX-2014-T、PHOENIX-2014-SI、CSL 和 CSL-Daily 五个基准上取得了最优或具竞争力的性能。代码与模型见 https://github.com/2000ZRL/LCSA_C2SLR_SRM。
引用
@article{arxiv.2212.13023,
title = {Improving Continuous Sign Language Recognition with Consistency Constraints and Signer Removal},
author = {Ronglai Zuo and Brian Mak},
journal= {arXiv preprint arXiv:2212.13023},
year = {2024}
}
备注
Accepted by ACM TOMM