DCAN:通过双重上下文聚合改进时序动作检测
计算机视觉与模式识别
2021-12-08 v1
摘要
时序动作检测旨在定位视频中动作的边界。当前基于边界匹配的方法枚举并计算所有可能的边界匹配以生成候选提案。然而,这些方法忽视了边界预测中的长程上下文聚合。同时,由于相邻匹配语义相似,对密集生成的匹配进行局部语义聚合无法提升语义丰富度与判别力。本文中,我们提出名为双重上下文聚合网络(DCAN)的端到端提案生成方法,在边界级和提案级两个层次上聚合上下文,以生成高质量动作提案,从而提升时序动作检测性能。具体而言,我们设计多路径时序上下文聚合(MTCA)以实现边界级平滑上下文聚合与边界精确评估。对于匹配评估,设计由粗到细匹配(CFM)在提案级聚合上下文并从粗到细细化匹配图。我们在 ActivityNet v1.3 和 THUMOS-14 上进行了大量实验。DCAN 在 ActivityNet v1.3 上取得 35.39% 的平均 mAP,并在 THUMOS-14 上 [email protected] 处达到 54.14% 的 mAP,表明 DCAN 能生成高质量提案并实现最先进性能。我们在 https://github.com/cg1177/DCAN 发布了代码。
引用
@article{arxiv.2112.03612,
title = {DCAN: Improving Temporal Action Detection via Dual Context Aggregation},
author = {Guo Chen and Yin-Dong Zheng and Limin Wang and Tong Lu},
journal= {arXiv preprint arXiv:2112.03612},
year = {2021}
}
备注
AAAI 2022 camera ready version