SignX:紧凑姿态丰富潜在空间中的连续手语识别
计算机视觉与模式识别
2026-04-20 v4 计算与语言
摘要
手语 (Sign Language, SL) 数据处理的复杂性带来了许多挑战。当前的方法旨在通过姿态信息将 RGB 手语视频翻译成 Word-based ID Glosses,以唯一标识手语。本文提出了 SignX,一个用于连续手语识别 (SLR) 的新型框架, operates in compact pose-rich latent space。首先,我们构建了一个统一的潜在表示,将异构姿态格式 (SMPLer-X、DWPose、Mediapipe、PrimeDepth 和 Sapiens Segmentation) 编码到紧凑、信息密集的空间中。其次,我们训练一个基于 ViT 的 Video-to-Pose 模块,从原始视频中直接提取此潜在表示。最后,我们开发了一个在该潜在空间中完全运行的时序建模和序列细化方法。这种多阶段设计在显著降低计算消耗的同时实现了端到端 SLR。实验结果表明,SignX 在连续 SLR 和 Translation 任务上实现了 SOTA 准确率,相较于像素空间基线快了近 50 倍。
引用
@article{arxiv.2504.16315,
title = {SignX: Continuous Sign Recognition in Compact Pose-Rich Latent Space},
author = {Sen Fang and Yalin Feng and Chunyu Sui and Hongbin Zhong and Yanxin Zhang and Hongwei Yi and Hezhen Hu and Dimitris N. Metaxas},
journal= {arXiv preprint arXiv:2504.16315},
year = {2026}
}
备注
33 pages, CSLR SOTA (2026). More demo at https://signerx.github.io/SignX/