中文

MGCA-Net:用于开放词汇 temporal 动作局部化的多粒度类别感知网络

计算机视觉与模式识别 2025-11-18 v1

摘要

开放词汇 temporal 动作局部化(OV-TAL)旨在识别和局部化视频中任何所需动作类别的实例,而无需为所有类别明确 curate 训练数据。现有方法大多在单一粒度上识别动作类别,导致 base 和 novel 动作类别的识别准确率下降。为解决这些问题,我们提出了多粒度类别感知网络(MGCA-Net),包括 localizer、动作存在预测器、常规分类器和粗到细分类器。具体而言,localizer 对类别无感知的动作提案进行局部化。对于这些动作提案,动作存在预测器估计它们属于动作实例的概率。同时,常规分类器在 snippet 粒度上预测每个动作提案在 base 动作类别上的概率。通过粗到细分类器识别 novel 动作类别,该分类器首先在 video 粒度上识别动作存在,然后在提案粒度上将每个动作提案分配给粗粒度类别中的一个类别。通过 novel 动作的粗到细类别感知和常规分类器对 base 动作的感知,实现了多粒度类别感知,有效提升了局部化性能。对 THUMOS'14 和 ActivityNet-1.3 基准进行全面评估表明,我们的方法在该领域实现了最先进的性能。此外,我们的 MGCA-Net 在 Zero-Shot Temporal 动作局部化 setting 下也取得了最先进的结果。

关键词

引用

@article{arxiv.2511.13039,
  title  = {MGCA-Net: Multi-Grained Category-Aware Network for Open-Vocabulary Temporal Action Localization},
  author = {Zhenying Fang and Richang Hong},
  journal= {arXiv preprint arXiv:2511.13039},
  year   = {2025}
}

备注

12 pages, 3 figures