基于跨层任务解耦与细化的时序动作定位
计算机视觉与模式识别
2024-12-16 v2
摘要
时序动作定位 (TAL) 涉及对未剪辑视频中动作进行分类与定位的双重任务。然而,这两个任务常对特征有冲突的需求。现有方法通常为分类和定位任务分别采用独立的头部,但共享相同的输入特征,导致性能次优。为解决此问题,本文提出一种基于跨层任务解耦与细化 (CLTDR) 的新型 TAL 方法。基于视频的特征金字塔,CLTDR 策略整合来自高层特征金字塔中语义强大的特征,以及来自低层特征金字塔中细致边界感知的特征,从而有效解耦动作分类与定位任务。此外,多个跨层特征也被用于细化和对齐解耦后的分类与回归结果。最后,本文提出一个轻量级的门控多粒度 (GMG) 模块,用于全面提取和聚合时序粒度为瞬时、局部和全局的视频特征。凭借 CLTDR 和 GMG 模块,我们的方法在五个具有挑战性的基准数据集上实现了最先进的性能:THUMOS14、MultiTHUMOS、EPIC-KITCHENS-100、ActivityNet-1.3 和 HACS。我们的代码和预训练模型已公开提供于:https://github.com/LiQiang0307/CLTDR-GMG。
引用
@article{arxiv.2412.09202,
title = {Temporal Action Localization with Cross Layer Task Decoupling and Refinement},
author = {Qiang Li and Di Liu and Jun Kong and Sen Li and Hui Xu and Jianzhong Wang},
journal= {arXiv preprint arXiv:2412.09202},
year = {2024}
}
备注
Accepted in AAAI 2025