ActionFormer:利用 Transformer 定位动作时刻
计算机视觉与模式识别
2022-08-30 v2
摘要
基于自注意力的 Transformer 模型已在图像分类和目标检测中展现出令人印象深刻的成果,近来在视频理解方面也是如此。受此成功启发,我们探究了 Transformer 网络在视频时间动作定位中的应用。为此,我们提出 ActionFormer——一个简洁而强大的模型,可在单次推理中识别时间上的动作并识别其类别,无需使用动作提议或依赖预定义锚定窗口。ActionFormer 将多尺度特征表示与局部自注意力相结合,并使用轻量解码器对每一时刻进行分类并估计相应的动作边界。我们表明这种协同设计带来了相较先前工作的重大改进。不加任何额外技巧,ActionFormer 在 THUMOS14 上 tIoU=0.5 时取得 71.0% mAP,比最佳先前模型高出 14.1 个绝对百分点。此外,ActionFormer 在 ActivityNet 1.3(平均 mAP 36.6%)和 EPIC-Kitchens 100(相较先前工作平均 mAP +13.5%)上展示了强劲结果。我们的代码见 http://github.com/happyharrycn/actionformer_release。
引用
@article{arxiv.2202.07925,
title = {ActionFormer: Localizing Moments of Actions with Transformers},
author = {Chenlin Zhang and Jianxin Wu and Yin Li},
journal= {arXiv preprint arXiv:2202.07925},
year = {2022}
}
备注
Accepted to ECCV 2022