中文

ContextDet:基于自适应上下文聚合的时序动作检测

计算机视觉与模式识别 2024-10-22 v1 人工智能 多媒体

摘要

时序动作检测(TAD)通过定位和识别动作片段来完成,这在视频理解中仍是一个具有挑战性的任务,由于片段长度可变且边界模糊。现有方法对动作片段的相邻上下文处理不均,导致边界预测不精确。我们引入一个单阶段的ContextDet框架,首次在TAD中运用大卷积核。我们的模型具备金字塔自适应上下文聚合(ACA)架构,能够捕获长范围上下文并提高动作辨识度。每个ACA级别由两个新模块组成。上下文注意力模块(CAM)识别突出的上下文信息,鼓励上下文多样性,并通过上下文门控块(CGB)保持上下文完整性。长上下文模块(LCM)运用大卷积核和小卷积核的混合方式,自适应地收集长程上下文和细粒度局部特征。此外,通过在ACA金字塔中变化这些大卷积核的长度,我们的模型提供了轻量且有效的上下文聚合和动作辨识。我们在六个具有挑战性的TAD基准数据集上进行了大量实验,包括MultiThumos、Charades、FineAction、EPIC-Kitchens 100、Thumos14和HACS,结果显示我们的方法在降低推理速度的同时实现了更高的准确率。

关键词

引用

@article{arxiv.2410.15279,
  title  = {ContextDet: Temporal Action Detection with Adaptive Context Aggregation},
  author = {Ning Wang and Yun Xiao and Xiaopeng Peng and Xiaojun Chang and Xuanhong Wang and Dingyi Fang},
  journal= {arXiv preprint arXiv:2410.15279},
  year   = {2024}
}