中文

ABN:用于时序动作候选生成的主agent感知边界网络

计算机视觉与模式识别 2022-03-18 v1

摘要

时序动作候选生成(TAPG)旨在估计未剪辑视频中动作的时间区间,这是一项具有挑战性但在许多视频分析与理解任务中发挥重要作用的工作。尽管TAPG取得了巨大成就,大多数现有工作通过将深度学习模型作为黑盒应用于未剪辑视频以提取视频视觉表征,忽略了人类对agent之间及其与周围环境交互的感知。因此,如果我们能够捕捉这些agent与环境之间的交互,将有益于并潜在地提升TAPG的性能。本文提出一种名为agent感知边界网络(ABN)的新框架,其由两个子网络组成:(i)agent感知表征网络,用于获取视频表征中agent-agent与agent-environment关系;(ii)边界生成网络,用于估计时间区间的置信度分数。在agent感知表征网络中,agent之间的交互通过局部通路表达,该通路在局部层面运作以关注agent的运动;而对周围环境的整体感知通过全局通路表达,该通路在全局层面运作以感知agent-environment的影响。在20类动作的THUMOS-14与200类动作的ActivityNet-1.3数据集上,采用不同骨干网络(即C3D、SlowFast和Two-Stream)的综合评估表明,无论采用何种骨干网络,我们提出的ABN均能稳健地优于TAPG上的SOTA方法。我们进一步通过将本方法生成的候选应用于时序动作检测(TAD)框架并评估其检测性能,来检验候选质量。源代码可在以下URL获取:https://github.com/vhvkhoa/TAPG-AgentEnvNetwork.git。

关键词

引用

@article{arxiv.2203.08942,
  title  = {ABN: Agent-Aware Boundary Networks for Temporal Action Proposal Generation},
  author = {Khoa Vo and Kashu Yamazaki and Sang Truong and Minh-Triet Tran and Akihiro Sugimoto and Ngan Le},
  journal= {arXiv preprint arXiv:2203.08942},
  year   = {2022}
}

备注

Accepted in the journal of IEEE Access Vol. 9