中文

CanonSLR:面向多视角连续手语识别的规范视角引导框架

计算机视觉与模式识别 2026-04-21 v1

摘要

连续手语识别 (CSLR) 在最近几年取得了显著进展;然而,大多数现有方法是在单视角设置下开发的,因此在现实场景中对视角变化仍不够稳健。为解决这一局限,我们提出了 CanonSLR,一种针对多视角 CSLR 的规范视角引导框架。具体而言,我们引入前景视角 anchoring 的教师-学生学习策略,其中在前景视角数据上训练的教师网络为训练于所有视角的学生网络提供规范时间监督。为进一步减少跨视角语义差异,我们提出了序列级软目标蒸馏,将前景视角的结构化时间知识传递到非前景样本中,从而缓解因遮挡和投影变化导致的 gloss 边界模糊和类别混淆。在此基础上,我们引入时序运动关系增强,以显式建模高层视觉特征中的运动感时序关系,强化稳定的动态表征,同时抑制视角敏感的外观干扰。为支持多视角 CSLR 研究,我们进一步开发了一个将原始单视图 RGB 视频转换为语义一致、时序连贯且可控视角的多视角手语视频的通用数据构建管道。基于此管道,我们将 PHOENIX-2014T 和 CSL-Daily 扩展为两个七视图基准,分别称为 PT14-MV 和 CSL-MV,为多视角 CSLR 提供了新的实验基础。对 PT14-MV 和 CSL-MV 上的大量实验表明,CanonSLR 在多视角设置下 consistently 超过现有方法,尤其在具有挑战性的非前景视角上表现更为稳健。

关键词

引用

@article{arxiv.2604.18184,
  title  = {CanonSLR: Canonical-View Guided Multi-View Continuous Sign Language Recognition},
  author = {Xu Wang and Shengeng Tang and Wan Jiang and Yaxiong Wang and Lechao Cheng and Richang Hong},
  journal= {arXiv preprint arXiv:2604.18184},
  year   = {2026}
}