基于记忆增强Transformer的在线时序动作定位
计算机视觉与模式识别
2024-08-07 v1
摘要
在线时序动作定位(On-TAL)是在给定流式视频的情况下识别多个动作实例的任务。由于现有方法每次迭代仅输入固定大小的视频片段,因此在考虑长期上下文方面存在局限,且需要仔细调整片段大小。为克服这些局限,我们提出记忆增强Transformer(MATR)。MATR 利用记忆队列选择性地保留过去片段特征,从而能够在推理中利用长期上下文。我们还提出了一种新颖的动作定位方法,该方法观察当前输入片段以预测正在进行的动作的结束时间,并访问记忆队列以估计动作的开始时间。我们的方法在两个数据集 THUMOS14 和 MUSES 上优于现有方法,不仅超越了在线设置下的 TAL 方法,还超越了一些离线 TAL 方法。
引用
@article{arxiv.2408.02957,
title = {Online Temporal Action Localization with Memory-Augmented Transformer},
author = {Youngkil Song and Dongkeun Kim and Minsu Cho and Suha Kwak},
journal= {arXiv preprint arXiv:2408.02957},
year = {2024}
}
备注
Accepted to ECCV 2024, Project page: https://cvlab.postech.ac.kr/research/MATR/