中文

用于时序动作候选生成的智能体-环境网络

计算机视觉与模式识别 2022-03-18 v3

摘要

时序动作候选生成是一项基础且具有挑战性的任务,旨在未剪辑视频中定位包含人类动作的时间区间。现有大多数方法由于缺乏表达动作概念、执行动作的智能体(agent)或智能体与环境之间交互的注意力机制,无法遵循人类理解视频上下文的认知过程。基于“人类(称为智能体)与环境交互并执行影响环境的动作”这一动作定义,我们提出了一种上下文感知的智能体-环境网络(Agent-Environment Network, AEN)。我们提出的上下文AEN包含:(i) 智能体路径,在局部层面刻画哪些人类/智能体正在执行动作;(ii) 环境路径,在全局层面刻画智能体如何与环境交互。在20类THUMOS-14和200类ActivityNet-1.3数据集上,采用不同骨干网络(即C3D和SlowFast)进行的综合评估表明,无论使用何种骨干网络,我们的方法都稳健地优于最先进(state-of-the-art, SOTA)方法。

关键词

引用

@article{arxiv.2107.08323,
  title  = {Agent-Environment Network for Temporal Action Proposal Generation},
  author = {Viet-Khoa Vo-Ho and Ngan Le and Kashu Yamazaki and Akihiro Sugimoto and Minh-Triet Tran},
  journal= {arXiv preprint arXiv:2107.08323},
  year   = {2022}
}

备注

Accepted in ICASSP 2021