基于自由形式文本查询的手语视频检索
计算机视觉与模式识别
2022-09-16 v2 人工智能
计算与语言
摘要
能够高效搜索手语视频集合的系统已被强调为手语技术的一个有用应用。然而,超越单个关键词的视频搜索问题在文献中受到的关注有限。为弥补这一空白,本文引入自由形式文本查询的手语检索任务:给定一个书面查询(如一个句子)和一个大规模手语视频集合,目标是在集合中找到与书面查询最匹配的手语视频。我们提出通过在最近引入的大规模美国手语(ASL)How2Sign 数据集上学习跨模态嵌入来解决该任务。我们确定系统性能的一个关键瓶颈是手语视频嵌入的质量,其受限于标注训练数据的匮乏。因此,我们提出 SPOT-ALIGN,一种交错迭代轮次的手语 spotting 与特征对齐框架,以扩展可用训练数据的范围与规模。我们通过手语识别和所提出的视频检索任务两方面的改进,验证了 SPOT-ALIGN 学习鲁棒手语视频嵌入的有效性。
引用
@article{arxiv.2201.02495,
title = {Sign Language Video Retrieval with Free-Form Textual Queries},
author = {Amanda Duarte and Samuel Albanie and Xavier Giró-i-Nieto and Gül Varol},
journal= {arXiv preprint arXiv:2201.02495},
year = {2022}
}
备注
In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2022