中文

借助手语词典扩展手语 spotting 规模

计算机视觉与模式识别 2022-05-10 v1

摘要

本工作的重点是 sign spotting\textit{sign spotting}(手语 spotting)——给定一段孤立手语视频,我们的任务是识别它在一段连续的、协同构音的手语视频中 是否\textit{是否} 以及 何处\textit{何处} 被比划出来。为完成该手语 spotting 任务,我们利用多种可用监督类型训练模型:(1)观看\textit{观看} 现有视频片段,其利用口动线索进行了稀疏标注;(2)阅读\textit{阅读} 相关字幕(手语内容的现成翻译),提供额外的 弱监督\textit{弱监督};(3)查阅\textit{查阅} 视觉手语词典中的词语(无可用协同构音标注样本),以实现新颖的手语 spotting。这三项任务通过噪声对比估计与多示例学习原理集成至统一学习框架中。我们在少样本手语 spotting 基准上验证了方法的有效性。此外,我们贡献了一个机器可读的英国手语(BSL)孤立手语词典数据集 BSLDict,以促进该任务的研究。数据集、模型与代码已发布于我们的项目页面。

关键词

引用

@article{arxiv.2205.04152,
  title  = {Scaling up sign spotting through sign language dictionaries},
  author = {Gül Varol and Liliane Momeni and Samuel Albanie and Triantafyllos Afouras and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2205.04152},
  year   = {2022}
}

备注

Appears in: 2022 International Journal of Computer Vision (IJCV). 25 pages. arXiv admin note: substantial text overlap with arXiv:2010.04002