开放词汇空间时空动作检测
计算机视觉与模式识别
2024-05-20 v1
摘要
时空动作检测(STAD)是重要的粗粒度视频理解任务。当前方法需要对所有动作类别提前进行框和标签监督。然而,在实际应用中,由于动作类别空间庞大且难以枚举,极可能遇到训练时未见的新动作类别。此外,对于传统方法而言,针对新类别进行详细的框标注和从头重新训练整个网络的成本极高。本文提出了一种新的设定,通过进行开放词汇STAD以更好地模拟开放世界中动作检测的情况。开放词汇时空动作检测(OV-STAD)要求在有限的基类上进行训练,仅使用框和标签监督,预期其在新动作类别上具有良好的泛化性能。为OV-STAD,我们基于现有STAD数据集构建了两个基准,并提出一种基于预训练视频语言模型(VLM)的简单而有效的方法。为更好地适应VLM以针对细粒度动作检测任务进行微调,我们在局部视频区域-文本对上进行精细微调。这种定制化的微调赋予VLM更好的运动理解能力,从而提高视频区域与文本之间的对齐精度。采用局部区域特征与全局视频特征在对齐前进行融合,以进一步提高动作检测性能,通过提供全局上下文。我们的方法在新类别上实现了令人振奋的性能。
引用
@article{arxiv.2405.10832,
title = {Open-Vocabulary Spatio-Temporal Action Detection},
author = {Tao Wu and Shuqiu Ge and Jie Qin and Gangshan Wu and Limin Wang},
journal= {arXiv preprint arXiv:2405.10832},
year = {2024}
}