USTM:用于连续手语识别的统一时空建模
计算机视觉与模式识别
2025-12-30 v2
摘要
连续手语识别(CSLR)需要精确的时空建模,才能准确识别视频中手势序列。现有方法常依赖基于卷积神经网络的空间骨干网络搭配时序卷积或循环模块,这些技术在捕捉细粒度的手部和面部线索方面有限,同时难以建模长程时序依赖。为此,我们提出了统一时空建模(USTM)框架,它是一种时空编码器,通过结合增强轻量时序适配器(TAPE)的 Swin Transformer 骨干网络和位置嵌入,有效地捕捉复杂模式。我们的框架在保持捕捉细粒度空间特征的同时,融合短期和长期时序语境,使其能够从 RGB 视频中实现鲁棒的手语识别,无需依赖多流输入或辅助模态。在包括 PHOENIX14、PHOENIX14T 和 CSL-Daily 在内的多个基准数据集上的大量实验表明,USTM 在 RGB 基于以及多模态 CSLR 方法中均实现了最先进的性能,同时在保持与多流方法竞争性能的同时也表现出色。这些结果凸显了 USTM 框架在 CSLR 领域的强大效能。代码已公开于 https://github.com/gufranSabri/USTM
引用
@article{arxiv.2512.13415,
title = {USTM: Unified Spatial and Temporal Modeling for Continuous Sign Language Recognition},
author = {Ahmed Abul Hasanaath and Hamzah Luqman},
journal= {arXiv preprint arXiv:2512.13415},
year = {2025}
}