中文

基于Transformer的端到端时间动作检测

计算机视觉与模式识别 2022-08-12 v4

摘要

时间动作检测(TAD)旨在确定未修剪视频中每个动作实例的语义标签和时间区间。它是视频理解中一项基础且具有挑战性的任务。以往方法以复杂流程处理该任务,常需训练多个网络并涉及非极大值抑制和锚框生成等手工设计操作,限制了灵活性并阻碍端到端学习。本文提出一种基于Transformer的端到端TAD方法,称为TadTR。给定一组称为动作查询(action queries)的可学习嵌入,TadTR自适应地从视频中提取每个查询的时间上下文信息,并直接以该上下文预测动作实例。为使Transformer适应TAD,我们提出三项改进以增强其局部感知能力。核心是时间可变形注意力模块,选择性关注视频中稀疏的关键片段集合。设计了片段细化机制和动作性回归头,分别用于细化预测实例的边界和置信度。凭借如此简单的流程,TadTR所需计算成本低于以往检测器,同时保持卓越性能。作为自包含检测器,它在THUMOS14(56.7% mAP)和HACS Segments(32.09% mAP)上达到最先进性能。结合额外动作分类器,其在ActivityNet-1.3上获得36.75% mAP。代码见 https://github.com/xlliu7/TadTR。

关键词

引用

@article{arxiv.2106.10271,
  title  = {End-to-end Temporal Action Detection with Transformer},
  author = {Xiaolong Liu and Qimeng Wang and Yao Hu and Xu Tang and Shiwei Zhang and Song Bai and Xiang Bai},
  journal= {arXiv preprint arXiv:2106.10271},
  year   = {2022}
}

备注

Accepted by IEEE Transactions on Image Processing (TIP). Code: https://github.com/xlliu7/TadTR