中文

用于直接动作提案生成的松弛Transformer解码器

计算机视觉与模式识别 2021-08-20 v3

摘要

时序动作提案生成是视频理解中的重要且富有挑战性的任务,旨在检测出所有包含感兴趣动作实例的时间段。现有提案生成方法通常基于预定义锚定窗口或启发式自底向上边界匹配策略。本文提出一种简单高效的框架(RTD-Net),通过改造类Transformer架构实现直接动作提案生成。为应对时间与空间之间的本质视觉差异,我们对原始Transformer检测框架(DETR)做了三项重要改进。首先,针对视频中的缓慢先验,我们将原始Transformer编码器替换为边界注意力模块以更好地捕获长程时序信息。其次,由于时间边界模糊且标注相对稀疏,我们提出一种松弛匹配方案,以缓解对每个真值仅单一分配的严格准则。最后,我们设计了一个三分支头,通过显式预测提案的完整度来进一步改进提案置信度估计。在THUMOS14与ActivityNet-1.3基准上的大量实验证明了RTD-Net在时序动作提案生成与时序动作检测两项任务上的有效性。此外,由于设计简洁,我们的框架无需非极大值抑制后处理,比以往提案生成方法更高效。代码与模型已发布于 https://github.com/MCG-NJU/RTD-Action。

关键词

引用

@article{arxiv.2102.01894,
  title  = {Relaxed Transformer Decoders for Direct Action Proposal Generation},
  author = {Jing Tan and Jiaqi Tang and Limin Wang and Gangshan Wu},
  journal= {arXiv preprint arXiv:2102.01894},
  year   = {2021}
}

备注

ICCV 2021 camera ready version