基于增强瞬时可分辨性的时序动作定位
计算机视觉与模式识别
2023-09-12 v1 人工智能
多媒体
摘要
时序动作检测(TAD)旨在检测未修剪视频中的所有动作边界及其对应类别。视频中动作边界不清晰常导致现有方法对动作边界的预测不精确。为解决此问题,我们提出一个名为 TriDet 的单阶段框架。首先,我们提出一个 Trident-head,通过估计边界周围的相对概率分布来建模动作边界。接着,我们分析基于 transformer 的方法中的排序损失问题(即瞬时可分辨性退化),并提出一种高效的可扩展粒度感知(SGP)层来缓解该问题。为进一步提升视频骨干网络中的瞬时可分辨性极限,我们利用预训练大模型的强表征能力,并考察它们在 TAD 上的性能。最后,考虑到分类所需的充分时空上下文,我们设计了一个解耦特征金字塔网络,采用分离的特征金字塔,以从大模型中融入丰富的空间上下文用于定位。实验结果表明了 TriDet 的鲁棒性及其在多个 TAD 数据集(包括分层(多标签)TAD 数据集)上的最先进性能。
引用
@article{arxiv.2309.05590,
title = {Temporal Action Localization with Enhanced Instant Discriminability},
author = {Dingfeng Shi and Qiong Cao and Yujie Zhong and Shan An and Jian Cheng and Haogang Zhu and Dacheng Tao},
journal= {arXiv preprint arXiv:2309.05590},
year = {2023}
}
备注
An extended version of the CVPR paper arXiv:2303.07347, submitted to IJCV