大规模词汇手语视频的自动稠密标注
计算机视觉与模式识别
2022-08-05 v1
摘要
近来,手语研究者转向使用手语翻译的电视广播作为易获取且大规模的训练数据源,其包含(i)连续手语视频与(ii)对应音频内容的字幕。此类数据可用性的一个关键挑战是缺乏手语标注。先前利用此类弱对齐数据的工作仅在字幕关键词与单个手势间发现稀疏对应。本工作中,我们提出一个简单、可扩展的框架以大幅提升自动标注的稠密程度。我们的贡献如下:(1)通过利用同义词与字幕-手语对齐,显著改进先前的标注方法;(2)展示来自手语识别模型的伪标签作为手语 spotting 的价值;(3)提出一种基于域内样本增加已知与未知类标注的新方法;(4)在BOBSL BSL手语语料上,我们将可信自动标注数量从670K增至5M。我们公开这些标注以支持手语研究社区。
引用
@article{arxiv.2208.02802,
title = {Automatic dense annotation of large-vocabulary sign language videos},
author = {Liliane Momeni and Hannah Bull and K R Prajwal and Samuel Albanie and Gül Varol and Andrew Zisserman},
journal= {arXiv preprint arXiv:2208.02802},
year = {2022}
}
备注
ECCV 2022 Camera Ready