中文

SignVerse-2M:55+ 种语言两百万剪辑姿态原生话语语言基准

计算机视觉与模式识别 2026-05-07 v2 人工智能 计算与语言

摘要

现有大规模手语资源通常仅在原始视频-文本对齐层面提供监督,且常在实验室环境中生产。虽然此类资源对语义理解至关重要,但直接为开放世界识别与翻译或现代姿态驱动手语视频生成框架提供统一接口。首先,基于固定背景或服装条件的 RGB 模型依赖严重,且在开放世界环境下不够稳健;其次,近期的姿态引导图像/视频生成模型大多使用统一的关键点表示如 DWPose 作为控制接口。目前手语领域仍缺乏一种数据资源,可直接与此现代姿态原生范式接口,同时针对真实世界开放场景。我们提出 SignVerse-2M,一个规模为两百万剪辑、覆盖55+ 种手语的大规模多语言姿态原生数据集,用于手语姿态建模与评估。该数据集基于公开的多语言手语视频资源构建,应用 DWPose 统一预处理管道将原始视频转换为可直接用于建模的 2D 姿态序列,形成约两百万剪辑的统一语料库,覆盖超过55种手语。与许多实验室数据集不同,该资源保留了真实世界视频的录制条件和说话者多样性,同时通过统一姿态表示降低了外观变异。为此,我们进一步提供数据构建管道、任务定义以及一个简单的 SignDW Transformer 基线,展示了该资源在多语言姿态空间建模中的可行性及其与现代姿态驱动管道的兼容性,同时讨论了其支持的评估诊断及当前限制。

关键词

引用

@article{arxiv.2605.01720,
  title  = {SignVerse-2M: A Two-Million-Clip Pose-Native Universe of 55+ Sign Languages},
  author = {Sen Fang and Hongbin Zhong and Yanxin Zhang and Dimitris N. Metaxas},
  journal= {arXiv preprint arXiv:2605.01720},
  year   = {2026}
}

备注

The included languages actually amount to 55+, and the 25 types refer to those that exceed 15 hours. 13 pages. Project Page at: https://signerx.github.io/SignVerse-2M/