用于手语 spotting 的分层 I3D
计算机视觉与模式识别
2022-10-04 v1
摘要
迄今为止,大多数基于视觉的手语研究都集中于孤立手语识别(ISLR),其目标是在给定短视频片段的情况下预测单个手语类别。尽管 ISLR 取得了显著进展,但其实际应用有限。在本文中,我们转而关注具有挑战性的手语 spotting 任务,其目标是在连续的协同发音手语视频中同时识别和定位手语。为解决当前基于 ISLR 模型的局限性,我们提出一种分层手语 spotting 方法,该方法学习从粗到细的时空手语特征,以利用不同时间层次的表示并提供更精确的手语定位。具体而言,我们开发了分层手语 I3D 模型(HS-I3D),其由一个分层网络头组成,该网络头附加到现有的时空 I3D 模型上,以利用网络不同层的特征。我们在 ChaLearn 2022 Sign Spotting Challenge - MSSL 赛道上评估 HS-I3D,取得了 0.607 的 SOTA F1 分数,这是该竞赛的冠军方案。
引用
@article{arxiv.2210.00951,
title = {Hierarchical I3D for Sign Spotting},
author = {Ryan Wong and Necati Cihan Camgöz and Richard Bowden},
journal= {arXiv preprint arXiv:2210.00951},
year = {2022}
}