利用VLM的可定位性与语义进行开放词汇动作检测
计算机视觉与模式识别
2024-11-19 v1
摘要
动作检测旨在从空间和时间上检测(识别和定位)视频中的人类动作。现有方法侧重于封闭集设置,其中动作检测器在固定动作类别集合的视频上进行训练和测试。然而,这种受限设置在开放世界中是不可行的,因为测试视频不可避免地超出训练的动作类别。在本文中,我们解决了实际且具有挑战性的开放词汇动作检测(OVAD)问题。其目标是在固定动作类别集合上训练模型的同时,检测测试视频中的任何动作。为了实现这种开放词汇能力,我们提出了一种新颖的方法OpenMixer,它利用了大型视觉语言模型(VLM)在基于查询的检测变换器(DETR)系列中的固有语义和可定位性。具体来说,OpenMixer由空间和时间OpenMixer块(S-OMB和T-OMB)以及动态融合对齐(DFA)模块开发而成。这三个组件共同享有预训练VLM的强大泛化能力和DETR设计的端到端学习的优点。此外,我们建立了各种设置下的OVAD基准,实验结果表明,OpenMixer在检测可见和不可见动作方面优于基线方法。我们在https://github.com/Cogito2012/OpenMixer上发布了代码、模型和数据集划分。
引用
@article{arxiv.2411.10922,
title = {Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection},
author = {Wentao Bao and Kai Li and Yuxiao Chen and Deep Patel and Martin Renqiang Min and Yu Kong},
journal= {arXiv preprint arXiv:2411.10922},
year = {2024}
}
备注
WACV 2025 Accepted