中文

SignDATA:用于手语翻译的数据流水线

计算机视觉与模式识别 2026-04-23 v1 计算与语言

摘要

手语数据集难以一致地预处理,因为它们在标注模式、片段时序、手语者取景和隐私约束方面各不相同。现有工作通常报告下游模型,而将原始视频转换为可用于训练的姿势或视频制品的预处理流水线仍然是碎片化的、后端特定的且文档记录薄弱。我们提出了SignDATA,一个配置驱动的预处理工具包,它将异构的手语语料库标准化为可比较的输出以供学习。该系统支持两种端到端方案:一种姿势方案,执行采集、清单化、人物定位、片段裁剪、关键点提取、归一化和WebDataset导出;以及一种视频方案,该方案用经过手语者裁剪的视频打包替换姿势提取。SignDATA在一个通用接口、类型化的作业模式、实验级覆盖以及具有配置和清单感知哈希的每阶段检查点背后,公开了可互换的MediaPipe和MMPose后端。我们通过一个以研究为导向的评估设计来验证该工具包,该设计侧重于后端比较、预处理消融实验以及数据集上的隐私感知视频生成。我们的贡献是为手语研究提供了一个可复现的预处理层,它使提取器选择、归一化策略和隐私权衡变得明确、可配置且可经验比较。代码可在 https://github.com/balaboom123/signdata-slt 获取。

关键词

引用

@article{arxiv.2604.20357,
  title  = {SignDATA: Data Pipeline for Sign Language Translation},
  author = {Kuanwei Chen and Tingyi Lin},
  journal= {arXiv preprint arXiv:2604.20357},
  year   = {2026}
}

备注

7 pages, 1 figure