SignRep:增强自监督手语表征
计算机视觉与模式识别
2025-03-12 v1
摘要
手语表征学习因其手语的复杂时空特性以及标注数据集的稀缺而面临独特挑战。现有方法要么依赖在通用视觉任务上预训练的模型(缺乏手语特定特征),要么使用复杂的多模态和多分支架构。为弥合这一差距,我们提出了一种可扩展的自监督框架用于手语表征学习。我们在训练RGB模型时利用了重要的手语先验。为此,我们利用基于骨架的简单但重要的线索,在预训练掩码自动编码器时使用。这些手语特定先验以及特征正则化和对抗性风格无关损失提供了强大的骨干网络。值得注意的是,我们的模型在推理时不需要骨架关键点,避免了下游任务中基于关键点模型的局限性。在微调后,我们在WLASL、ASL-Citizen和NMFs-CSL数据集上实现了手语识别的最先进性能,使用更简单的架构且仅采用单模态。此外,我们的冻结模型在手语词典检索和手语翻译方面表现出色,超越了标准MAE预训练和基于骨架的表征。它还降低了现有手语翻译模型的训练计算成本,同时在Phoenix2014T、CSL-Daily和How2Sign上保持了强劲性能。
引用
@article{arxiv.2503.08529,
title = {SignRep: Enhancing Self-Supervised Sign Representations},
author = {Ryan Wong and Necati Cihan Camgoz and Richard Bowden},
journal= {arXiv preprint arXiv:2503.08529},
year = {2025}
}