中文

面向低样本时序动作定位的多模态提示

计算机视觉与模式识别 2023-03-22 v1

摘要

在本文中,我们考虑低样本(零样本与少样本)场景下的时序动作定位问题,目标是检测并分类未修剪视频中来自任意类别(甚至在训练时未见过)的动作实例。我们采用基于 Transformer 的两阶段动作定位架构,先进行类别无关的动作提议,再进行开放词汇分类。我们的贡献如下。首先,为弥补图像-文本基础模型在时序运动上的不足,我们通过显式对齐光流、RGB 与文本的嵌入来改进类别无关动作提议,而现有低样本方法大多忽略了这一点。其次,为改进开放词汇动作分类,我们构建具有强判别力的分类器,即避免词汇歧义。具体而言,我们提出以详细动作描述(从大规模语言模型获取)或视觉条件的实例特定提示向量来提示预训练的 CLIP 文本编码器。第三,我们在 THUMOS14 和 ActivityNet1.3 上进行了充分的实验与消融研究,证明了我们所提模型的优越性能,以显著优势超越了现有的最优方法。

关键词

引用

@article{arxiv.2303.11732,
  title  = {Multi-modal Prompting for Low-Shot Temporal Action Localization},
  author = {Chen Ju and Zeqian Li and Peisen Zhao and Ya Zhang and Xiaopeng Zhang and Qi Tian and Yanfeng Wang and Weidi Xie},
  journal= {arXiv preprint arXiv:2303.11732},
  year   = {2023}
}