中文

SignAvatars:大规模3D手语整体运动数据集与基准

计算机视觉与模式识别 2024-07-03 v3

摘要

我们提出SignAvatars,首个大规模、多提示的3D手语(SL)运动数据集,旨在弥合聋人和听障人士的沟通鸿沟。尽管关于数字通信的研究呈指数增长,现有多数通信技术主要服务于口语或书面语,而非聋人和听障群体必需交流方式的SL。现有SL数据集、词典和手语生成(SLP)方法通常局限于2D,因为标注SL的3D模型和虚拟形象通常是由SL专家进行的完全手动且劳动密集型的过程,常导致不自然的虚拟形象。为应对这些挑战,我们编撰并整理了SignAvatars数据集,包含来自153名手语者的70,000个视频,总计834万帧,覆盖孤立手势和连续的协同发音手势,具有包括HamNoSys、口语和单词在内的多种提示。为产生3D整体标注(包括身体、手和面的网格及生物力学有效姿态,以及2D和3D关键点),我们引入了基于大规模SL视频语料的自动标注流水线。SignAvatars支持多种任务,如3D手语识别(SLR)以及从文本脚本、单个单词和HamNoSys记法等不同输入进行的新型3D SL生成(SLP)。因此,为评估SignAvatars的潜力,我们进一步提出了3D SL整体运动生成的统一基准。我们相信该工作是将数字世界带给聋人和听障群体及其互动者的重要一步。

关键词

引用

@article{arxiv.2310.20436,
  title  = {SignAvatars: A Large-scale 3D Sign Language Holistic Motion Dataset and Benchmark},
  author = {Zhengdi Yu and Shaoli Huang and Yongkang Cheng and Tolga Birdal},
  journal= {arXiv preprint arXiv:2310.20436},
  year   = {2024}
}

备注

ECCV2024 14 pages; Project page available at https://signavatars.github.io/