中文

利用已有在线资源:基于在线词典的少样本手语识别

计算机视觉与模式识别 2023-01-11 v1

摘要

当今的手语识别模型需要大量类似实验室视频的训练语料,其收集涉及庞大的劳动力和财力资源。因此,只有少数此类系统公开可用,更不用说其对使用人数较少的手语有限的本地化能力。利用在线文本到视频词典(其天然持有各种属性和手语的标注数据)并以少样本方式训练模型,从而为该技术的普及提供了一条有前景的路径。在这项工作中,我们收集并开源了UWB-SL-Wild少样本数据集,这是首个由词典抓取视频组成的此类训练资源。该数据集代表了可用在线手语数据的实际分布与特征。我们选择了与已有数据集WLASL100和ASLLVD直接重叠的词汇,并共享其类别映射以进行迁移学习实验。除了基于姿态的架构提供基线结果外,我们引入了一种在少样本场景下训练手语识别模型的新方法,在ASLLVD-Skeleton和ASLLVD-Skeleton-20数据集上取得了最先进的结果,其top-1准确率分别为30.97 %30.97~\%95.45 %95.45~\%

关键词

引用

@article{arxiv.2301.03769,
  title  = {Learning from What is Already Out There: Few-shot Sign Language Recognition with Online Dictionaries},
  author = {Matyáš Boháček and Marek Hrúz},
  journal= {arXiv preprint arXiv:2301.03769},
  year   = {2023}
}

备注

6 pages, 2 figures, IEEE Face & Gestures 2023