中文

面向大规模符号语言理解的统一框架——Uni-Sign

计算机视觉与模式识别 2025-03-14 v3

摘要

符号语言预训练因其能够提升各种符号语言理解(SLU)任务性能而日益受到关注。然而,现有方法常常存在预训练与微调之间的鸿沟,导致结果不理想。为此,本文提出了Uni-Sign,一种统一的预训练框架,通过大规模生成式预训练策略和新颖的微调范式消除预训练与下游SLU任务之间的鸿沟。首先,我们引入CSL-News,一个包含1,985小时中文符号语言(CSL)视频数据集,配有文本注释,有效支持大规模预训练。其次,Uni-Sign通过在微调期间将下游任务统一为单个符号语言翻译(SLT)任务,确保预训练与微调之间的无缝知识迁移。进一步,本文引入先验引导融合(PGF)模块和得分感知抽样策略,高效融合姿态和RGB信息,解决关键点不准问题并提高计算效率。广泛的实验表明,Uni-Sign在多个SLU基准任务上实现了最先进的性能。数据集和代码已提供于github.com/ZechengLi19/Uni-Sign。

关键词

引用

@article{arxiv.2501.15187,
  title  = {Uni-Sign: Toward Unified Sign Language Understanding at Scale},
  author = {Zecheng Li and Wengang Zhou and Weichao Zhao and Kepeng Wu and Hezhen Hu and Houqiang Li},
  journal= {arXiv preprint arXiv:2501.15187},
  year   = {2025}
}

备注

Accepted by ICLR 2025