中文

ZEETAD:适配预训练视觉-语言模型用于零样本端到端时序动作检测

计算机视觉与模式识别 2023-11-08 v2 人工智能

摘要

时序动作检测(TAD)涉及在未裁剪视频中定位和分类动作实例。标准 TAD 在大量训练数据上遵循闭集环境下的全监督学习,而近期的零样本 TAD 方法通过利用大规模对比视觉-语言(ViL)预训练模型展示了有前景的开集设置。然而,现有零样本 TAD 方法在如何恰当地构建定位与分类这两个相互依赖任务之间的强关系,以及将 ViL 模型适配到视频理解方面存在局限。本工作中,我们提出 ZEETAD,具有两个模块:双定位与零样本提议分类。前者是基于 Transformer 的模块,检测动作事件同时选择性收集关键语义嵌入以供后续识别。后者是基于 CLIP 的模块,从文本和帧输入为每个时间单元生成语义嵌入。此外,我们通过用轻量适配器最小更新冻结的 CLIP 编码器,增强对未见类的判别能力。在 THUMOS14 和 ActivityNet-1.3 数据集上的大量实验证明了我们的方法在零样本 TAD 中的优越性能,以及从 ViL 模型到未见动作类别的有效知识迁移。

引用

@article{arxiv.2311.00729,
  title  = {ZEETAD: Adapting Pretrained Vision-Language Model for Zero-Shot End-to-End Temporal Action Detection},
  author = {Thinh Phan and Khoa Vo and Duy Le and Gianfranco Doretto and Donald Adjeroh and Ngan Le},
  journal= {arXiv preprint arXiv:2311.00729},
  year   = {2023}
}