中文

TCNet:基于轨迹与相关区域的连续手语识别

计算机视觉与模式识别 2024-03-19 v1

摘要

连续手语识别(CSLR)的一个关键挑战是如何从视频输入中高效捕捉随时间变化的长距离空间交互。为应对这一挑战,我们提出了 TCNet,这是一种能够从轨迹与相关区域中有效建模时空信息的混合网络。TCNet 的轨迹模块将帧转换为由连续视觉 token 组成的对齐轨迹。此外,对于查询 token,沿轨迹学习自注意力。如此,我们的网络还能聚焦于运动中特定区域的细粒度时空模式,如手指运动。TCNet 的相关模块使用一种新颖的动态注意力机制来滤除不相关的帧区域。此外,它将来自相关区域的动态键值 token 分配给每个查询。这两项创新显著降低了计算成本与内存消耗。我们在四个大规模数据集上进行了实验:PHOENIX14、PHOENIX14-T、CSL 和 CSL-Daily。结果表明,TCNet 持续取得 SOTA 性能。例如,在 PHOENIX14 和 PHOENIX14-T 上,我们的词错率分别比之前的 SOTA 降低了 1.5% 和 1.0%。

关键词

引用

@article{arxiv.2403.11818,
  title  = {TCNet: Continuous Sign Language Recognition from Trajectories and Correlated Regions},
  author = {Hui Lu and Albert Ali Salah and Ronald Poppe},
  journal= {arXiv preprint arXiv:2403.11818},
  year   = {2024}
}