观看、阅读与查找:学习从多个监督者中发现手语
计算机视觉与模式识别
2020-10-09 v1
摘要
本工作的重点是手语发现——给定一个孤立手语的视频,我们的任务是在连续的、协同发音的手语视频中识别它是否以及在哪里被手语表达。为了完成这一手语发现任务,我们利用多种可用监督类型训练了一个模型:(1) 观看现有的稀疏标注视频片段;(2) 阅读相关字幕(手语内容的现成翻译),提供额外的弱监督;(3) 在视觉手语词典中查找单词(没有协同发音的标注示例),以实现新颖的手语发现。使用噪声对比估计和多示例学习的原理,这三个任务被集成到一个统一的学习框架中。我们在低样本手语发现基准上验证了我们方法的有效性。此外,我们贡献了一个机器可读的英国手语(BSL)孤立手语词典数据集BSLDict,以促进对该任务的研究。数据集、模型和代码可在我们的项目页面上获取。
引用
@article{arxiv.2010.04002,
title = {Watch, read and lookup: learning to spot signs from multiple supervisors},
author = {Liliane Momeni and Gül Varol and Samuel Albanie and Triantafyllos Afouras and Andrew Zisserman},
journal= {arXiv preprint arXiv:2010.04002},
year = {2020}
}
备注
Appears in: Asian Conference on Computer Vision 2020 (ACCV 2020) - Oral presentation. 29 pages