寻找手势:在连续视频片段中识别孤立手势实例
计算机视觉与模式识别
2021-11-23 v2
摘要
在本文中,我们聚焦于单次手势发现任务,即给定一个孤立手势的示例(查询),我们希望识别该手势是否/何处出现在连续的、协同发音的手语视频(目标)中。为实现此目标,我们提出了一种基于 Transformer 的网络,称为 SignLookup。我们采用 3D 卷积神经网络(CNN)从视频片段中提取时空表示。为解决查询视频与目标视频之间的时间尺度差异,我们使用不同的帧级步幅从单个视频片段构建多个查询。在这些查询片段之间应用自注意力以模拟连续尺度空间。我们还在目标视频上利用另一个自注意力模块来学习序列内的上下文。最后,使用相互注意力来匹配时间尺度,以在目标序列内定位查询。大量实验表明,所提方法不仅能可靠地识别连续视频中的孤立手势,且不受手语者外观影响,还能泛化到不同的手语。得益于注意力机制和自适应特征,我们的模型在手势发现任务上实现了 SOTA 性能,在具有挑战性的基准数据集上准确率高达 96%,显著优于其他方法。
关键词
引用
@article{arxiv.2108.04229,
title = {Looking for the Signs: Identifying Isolated Sign Instances in Continuous Video Footage},
author = {Tao Jiang and Necati Cihan Camgoz and Richard Bowden},
journal= {arXiv preprint arXiv:2108.04229},
year = {2021}
}
备注
8 pages, 2 figures