中文

阅读与注意力:手语视频中的时间定位

计算机视觉与模式识别 2021-03-31 v1

摘要

本工作的目标是在连续手语中标注广泛词汇的手势实例。我们训练一个 Transformer 模型,在带有弱对齐字幕的大规模手语视频集合上摄取连续手语流并输出书面符号序列。我们表明,通过此训练,它获得了关注输入序列中大量手语实例的能力,从而实现其定位。我们的贡献如下:(1)我们展示了利用带有弱对齐字幕的大量连续手语视频来定位连续手语中手势的能力;(2)我们利用学到的注意力自动为大型手语词汇生成数十万条标注;(3)我们收集了一组跨越 950 个手语类别的 37K 人工验证手势实例,以支持我们的手语识别研究;(4)通过在我们的方法新标注的数据上训练,我们在 BSL-1K 手语识别基准上超越了先前的最先进(state of the art)水平。

关键词

引用

@article{arxiv.2103.16481,
  title  = {Read and Attend: Temporal Localisation in Sign Language Videos},
  author = {Gül Varol and Liliane Momeni and Samuel Albanie and Triantafyllos Afouras and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2103.16481},
  year   = {2021}
}

备注

Appears in: 2021 IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2021). 14 pages