BSL-1K:利用口动线索扩展协同构音手语识别
计算机视觉与模式识别
2021-10-14 v2
摘要
细粒度手势与动作分类以及机器翻译的最新进展,预示着自动手语识别成为现实的可能性。阻碍朝此目标进展的一个关键障碍是缺乏适当的训练数据,其源于手语标注的高复杂性以及合格标注人员的有限供给。本工作中,我们提出一种用于连续视频中手语识别数据采集的新可扩展方法。我们利用广播素材的弱对齐字幕,结合关键词 spotting 方法,在 1000 小时视频中自动定位词汇量为 1000 个手语实例。我们作出以下贡献:(1)展示如何利用手语者的口动线索从视频数据获取高质量标注——结果为 BSL-1K 数据集,一个规模空前的英国手语(BSL)手语集合;(2)展示我们能用 BSL-1K 训练用于 BSL 中协同构音手语的强手语识别模型,且这些模型额外构成对其他手语与基准的优秀预训练——我们在 MSASL 与 WLASL 两个基准上均超越当前最优。最后,(3)我们提出用于手语识别与手语 spotting 任务的新大规模评测集,并提供基线,期望能刺激该领域研究。
引用
@article{arxiv.2007.12131,
title = {BSL-1K: Scaling up co-articulated sign language recognition using mouthing cues},
author = {Samuel Albanie and Gül Varol and Liliane Momeni and Triantafyllos Afouras and Joon Son Chung and Neil Fox and Andrew Zisserman},
journal= {arXiv preprint arXiv:2007.12131},
year = {2021}
}
备注
Appears in: European Conference on Computer Vision 2020 (ECCV 2020). 28 pages