利用已有在线资源:基于在线词典的少样本手语识别
计算机视觉与模式识别
2023-01-11 v1
摘要
当今的手语识别模型需要大量类似实验室视频的训练语料,其收集涉及庞大的劳动力和财力资源。因此,只有少数此类系统公开可用,更不用说其对使用人数较少的手语有限的本地化能力。利用在线文本到视频词典(其天然持有各种属性和手语的标注数据)并以少样本方式训练模型,从而为该技术的普及提供了一条有前景的路径。在这项工作中,我们收集并开源了UWB-SL-Wild少样本数据集,这是首个由词典抓取视频组成的此类训练资源。该数据集代表了可用在线手语数据的实际分布与特征。我们选择了与已有数据集WLASL100和ASLLVD直接重叠的词汇,并共享其类别映射以进行迁移学习实验。除了基于姿态的架构提供基线结果外,我们引入了一种在少样本场景下训练手语识别模型的新方法,在ASLLVD-Skeleton和ASLLVD-Skeleton-20数据集上取得了最先进的结果,其top-1准确率分别为和。
引用
@article{arxiv.2301.03769,
title = {Learning from What is Already Out There: Few-shot Sign Language Recognition with Online Dictionaries},
author = {Matyáš Boháček and Marek Hrúz},
journal= {arXiv preprint arXiv:2301.03769},
year = {2023}
}
备注
6 pages, 2 figures, IEEE Face & Gestures 2023