用于时序动作定位的活动图 Transformer
计算机视觉与模式识别
2021-01-29 v2 人工智能
摘要
我们提出了活动图 Transformer,一种用于时序动作定位的端到端可学习模型,该模型接收视频作为输入并直接预测视频中出现的一组动作实例。在未裁剪视频中检测和定位动作实例需要对视频中的多个动作实例进行推理。文献中的主导范式对视频进行时序处理,以提出动作区域或直接产生帧级检测。然而,当动作实例具有非时序依赖和/或非线性时序排序(例如重叠的动作实例或动作实例在视频过程中的重复出现)时,视频的时序处理是有问题的。在这项工作中,我们通过将视频作为图形式的非时序实体进行推理来捕捉这种非线性时序结构。我们在具有挑战性的数据集 THUMOS14、Charades 和 EPIC-Kitchens-100 上评估了我们的模型。我们的结果表明,我们提出的模型以可观的幅度优于当前最优方法。
引用
@article{arxiv.2101.08540,
title = {Activity Graph Transformer for Temporal Action Localization},
author = {Megha Nawhal and Greg Mori},
journal= {arXiv preprint arXiv:2101.08540},
year = {2021}
}
备注
Project webpage: https://www.sfu.ca/~mnawhal/projects/agt.html; Code available at https://github.com/Nmegha2601/activitygraph_transformer