零样本手语识别:文本数据能否揭示手语?
计算机视觉与模式识别
2019-07-25 v1
摘要
我们引入了零样本手语识别问题,其目标是利用在已见手语类别样本上学习到的模型来识别未见手语的实例。为此,我们提出利用手语词典中现成的描述作为知识迁移的中间层语义表示。我们引入了一个名为 ASL-Text 的新基准数据集,包含 250 个手语类别及其附带的文本描述。与其他领域的零样本学习数据集(如目标识别)相比,我们的数据集包含大量类别但训练样本数量有限,这构成了重大挑战。我们提出了一个框架,通过 3D-CNN 对身体和手部区域进行操作,并通过双向 LSTM 对较长的时序关系进行建模。通过在零样本学习框架内利用描述性文本嵌入以及这些时空表示,我们表明文本数据确实有助于揭示手语。我们预期,所引入的方法和附带的数据集将为这一新零样本学习问题的进一步探索提供基础。
引用
@article{arxiv.1907.10292,
title = {Zero-Shot Sign Language Recognition: Can Textual Data Uncover Sign Languages?},
author = {Yunus Can Bilge and Nazli Ikizler-Cinbis and Ramazan Gokberk Cinbis},
journal= {arXiv preprint arXiv:1907.10292},
year = {2019}
}
备注
To appear in British Machine Vision Conference (BMVC) 2019