中文

基于视觉-语言提示的零样本时序动作检测

计算机视觉与模式识别 2022-07-19 v1 人工智能 计算与语言 多媒体

摘要

现有的时序动作检测(TAD)方法依赖包含片段级标注的大规模训练数据,在推理时仅限于识别先前见过的类别。为每类感兴趣的动作收集并标注大规模训练集成本高昂因而不可扩展。零样本 TAD(ZS-TAD)通过使预训练模型能识别任意未见动作类别来解决此障碍。同时,ZS-TAD 也更具挑战性且研究明显不足。受借助 CLIP 等视觉-语言(ViL)模型辅助的零样本图像分类成功的启发,我们旨在攻克更复杂的 TAD 任务。一种直观方法是将现成提案检测器与 CLIP 风格分类相结合。然而,由于顺序定位(如提案生成)与分类的设计,其易遭受定位错误传播。为克服该问题,本文提出一种基于视觉-语言提示(Vision-LanguagE prompting)的新型零样本时序动作检测模型(STALE)。此种新颖设计通过切断其间错误传播路径,有效消除了定位与分类间的依赖。我们进一步引入分类与定位间的交互机制以改进优化。在标准 ZS-TAD 视频基准上的大量实验表明,我们的 STALE 显著优于最先进的替代方法。此外,在监督 TAD 上我们的模型也优于近期强劲竞争者。STALE 的 PyTorch 实现见 https://github.com/sauradip/STALE。

关键词

引用

@article{arxiv.2207.08184,
  title  = {Zero-Shot Temporal Action Detection via Vision-Language Prompting},
  author = {Sauradip Nag and Xiatian Zhu and Yi-Zhe Song and Tao Xiang},
  journal= {arXiv preprint arXiv:2207.08184},
  year   = {2022}
}

备注

ECCV 2022; Code available at https://github.com/sauradip/STALE