中文

面向完整性:面向零样本时序动作定位的通用动作提案生成器

计算机视觉与模式识别 2024-08-27 v1

摘要

为解决零样本时序动作定位(ZSTAL)任务,现有方法开发了针对不可见类别的可通用检测和分类动作的模型,通常采用类别无关的动作检测器并结合对比语言-图像预训练(CLIP)模型来解决 ZSTAL。然而,这些方法因遵循帧级预测范例且需要手工后处理来生成动作提案,导致针对不可见类别的提案不完整。为此,本文提出一种名为 Generalizable Action Proposal generator(GAP)的新型模型,可与 CLIP 无缝接口并以整体方式生成动作提案。我们的 GAP 基于查询架构构建并以提案级目标进行训练,使其能够估计提案的完整性并消除手工后处理。基于此架构,我们提出了 Action-aware Discrimination loss 以增强类别无关的动态动作信息。此外,我们引入 Static-Dynamic Rectifying 模块,将 CLIP 提供的通用静态信息纳入以以通用方式细化预测提案,从而提高提案的完整性。我们的实验表明,GAP 在两个具有挑战性的 ZSTAL 基准测试(即 Thumos14 和 ActivityNet1.3)上实现了状态-of-the-art 性能。具体而言,本模型在两个基准测试上相对于前序工作实现了 +3.2% 和 +3.4% 的平均 mAP 提升。

关键词

引用

@article{arxiv.2408.13777,
  title  = {Towards Completeness: A Generalizable Action Proposal Generator for Zero-Shot Temporal Action Localization},
  author = {Jia-Run Du and Kun-Yu Lin and Jingke Meng and Wei-Shi Zheng},
  journal= {arXiv preprint arXiv:2408.13777},
  year   = {2024}
}

备注

Accepted to ICPR 2024. Code is available at https://github.com/Run542968/GAP