中文

DESign:面向连续手语识别的动态上下文感知卷积与高效子网正则化

计算机视觉与模式识别 2025-07-08 v1 人工智能

摘要

当前的连续手语识别(CSLR)方法在处理多样本时面临挑战。尽管动态卷积对此任务较为理想,但它们主要关注空间建模,未能捕捉时间动态和上下文依赖关系。为解决此问题,我们提出DESign,一种融合动态上下文感知卷积(DCAC)和子网正则化连接主义时序分类(SR-CTC)的新框架。DCAC动态捕捉构成手语的帧间运动线索,并基于上下文信息以细粒度方式独特地调整卷积权重,使模型能更好地泛化到多样化的手语行为并提升识别精度。此外,我们观察到现有方法在训练期间仍仅依赖有限数量的帧进行参数更新,表明CTC学习过拟合于主导路径。为此,SR-CTC通过对子网络施加监督来正则化训练,鼓励模型探索多样的CTC对齐路径,有效防止过拟合。SR-CTC中的分类器共享策略进一步增强了多尺度一致性。值得注意的是,SR-CTC不引入推理开销,可无缝集成到现有CSLR模型中以提升性能。大量消融实验和可视化进一步验证了所提方法的有效性。在主流CSLR数据集(即PHOENIX14、PHOENIX14-T、CSL-Daily)上的结果表明,DESign达到了最先进的性能。

关键词

引用

@article{arxiv.2507.03339,
  title  = {DESign: Dynamic Context-Aware Convolution and Efficient Subnet Regularization for Continuous Sign Language Recognition},
  author = {Sheng Liu and Yiheng Yu and Yuan Feng and Min Xu and Zhelun Jin and Yining Jiang and Tiantian Yuan},
  journal= {arXiv preprint arXiv:2507.03339},
  year   = {2025}
}