中文

STARK:用于连续手语识别的关键点表示的时空注意力机制

计算机视觉与模式识别 2026-03-18 v1 计算与语言

摘要

连续手语识别 (CSLR) 是理解 deaf 社群语言的关键任务。当代基于关键点的方法通常依赖时空编码,其中空间交互通过图卷积网络或注意力机制建模,而时间动态则通过 1D 卷积网络捕获。然而,这类设计常在编码器和解码器中引入大量参数。本文引入一个统一的时空注意力网络,同时在空间上(跨关键点)和时间上(局部窗口内)计算注意力得分,将特征聚合以产生局部感知时空表示。 proposed 编码器的参数数量约为现有 SOTA 模型的 70-80%,在 Phoenix-14T 数据集上实现了与关键点方法相当的性能。

关键词

引用

@article{arxiv.2603.16163,
  title  = {STARK: Spatio-Temporal Attention for Representation of Keypoints for Continuous Sign Language Recognition},
  author = {Suvajit Patra and Soumitra Samanta},
  journal= {arXiv preprint arXiv:2603.16163},
  year   = {2026}
}