中文

基于增强瞬时可分辨性的时序动作定位

计算机视觉与模式识别 2023-09-12 v1 人工智能 多媒体

摘要

时序动作检测(TAD)旨在检测未修剪视频中的所有动作边界及其对应类别。视频中动作边界不清晰常导致现有方法对动作边界的预测不精确。为解决此问题,我们提出一个名为 TriDet 的单阶段框架。首先,我们提出一个 Trident-head,通过估计边界周围的相对概率分布来建模动作边界。接着,我们分析基于 transformer 的方法中的排序损失问题(即瞬时可分辨性退化),并提出一种高效的可扩展粒度感知(SGP)层来缓解该问题。为进一步提升视频骨干网络中的瞬时可分辨性极限,我们利用预训练大模型的强表征能力,并考察它们在 TAD 上的性能。最后,考虑到分类所需的充分时空上下文,我们设计了一个解耦特征金字塔网络,采用分离的特征金字塔,以从大模型中融入丰富的空间上下文用于定位。实验结果表明了 TriDet 的鲁棒性及其在多个 TAD 数据集(包括分层(多标签)TAD 数据集)上的最先进性能。

关键词

引用

@article{arxiv.2309.05590,
  title  = {Temporal Action Localization with Enhanced Instant Discriminability},
  author = {Dingfeng Shi and Qiong Cao and Yujie Zhong and Shan An and Jian Cheng and Haogang Zhu and Dacheng Tao},
  journal= {arXiv preprint arXiv:2309.05590},
  year   = {2023}
}

备注

An extended version of the CVPR paper arXiv:2303.07347, submitted to IJCV