HTNet:基于分层Transformer的无锚时序动作定位
计算机视觉与模式识别
2022-07-22 v2
摘要
时序动作定位(TAL)是一项在视频中识别一组动作的任务,涉及定位起始和结束帧并对每个动作实例进行分类。现有方法通过使用预定义锚窗口或启发式自底向上边界匹配策略来解决该任务,这在推理时间上是主要瓶颈。此外,主要挑战是由于缺乏全局上下文信息而无法捕捉长时序动作。在本文中,我们提出了一种新颖的无锚框架,称为HTNet,它基于Transformer架构从视频中预测一组<起始时间, 结束时间, 类别>三元组。在预测粗略边界后,我们通过背景特征采样(BFS)模块和分层Transformer对其进行细化,这使我们的模型能够聚合全局上下文信息并有效利用视频中固有的语义关系。我们展示了我们的方法如何定位准确的动作实例,并在两个TAL基准数据集THUMOS14和ActivityNet 1.3上取得最先进的性能。
引用
@article{arxiv.2207.09662,
title = {HTNet: Anchor-free Temporal Action Localization with Hierarchical Transformers},
author = {Tae-Kyung Kang and Gun-Hee Lee and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2207.09662},
year = {2022}
}
备注
6 pages