SimOn:一种用于在线时序动作定位的简单框架
计算机视觉与模式识别
2022-11-10 v1
摘要
在线时序动作定位(On-TAL)旨在从未裁剪的流式视频中即时提供动作实例。模型不允许利用未来帧以及任何修改过去预测的处理技术,使得 On-TAL 更具挑战性。本文中,我们提出一个简单而有效的框架,称为 SimOn,它以端到端方式学习使用流行的 Transformer 架构预测动作实例。具体而言,模型将当前帧特征作为查询,并将一组过去上下文信息作为 Transformer 的键和值。不同于先前工作使用模型的一组输出作为过去上下文,我们利用过去的视觉上下文与可学习的上下文嵌入作为当前查询。在 THUMOS14 和 ActivityNet1.3 数据集上的实验结果表明,我们的模型显著优于先前方法,取得了新的最先进 On-TAL 性能。此外,针对动作起始在线检测(ODAS)的评估展示了我们的方法在在线设定下的有效性与鲁棒性。代码可在 https://github.com/TuanTNG/SimOn 获取。
引用
@article{arxiv.2211.04905,
title = {SimOn: A Simple Framework for Online Temporal Action Localization},
author = {Tuan N. Tang and Jungin Park and Kwonyoung Kim and Kwanghoon Sohn},
journal= {arXiv preprint arXiv:2211.04905},
year = {2022}
}