评估Transformer在轻量级动作识别中的表现
计算机视觉与模式识别
2021-12-09 v2
摘要
在视频动作识别中,Transformer持续达到最先进的准确率。然而,许多模型对于硬件资源有限的平均研究者而言过于繁重。本工作中,我们探索视频Transformer在轻量级动作识别中的局限性。我们在3个大规模数据集和10个硬件设备上对13个视频Transformer与基线进行了基准测试。我们的研究首次深入评估了动作识别模型跨多种设备的效率,并在相同条件下训练了广泛的视频Transformer。我们将现有方法分为三类,并表明增强卷积骨干的复合Transformer在轻量级动作识别中表现最佳,尽管精度不足。同时,纯注意力模型需要更强的运动建模能力,而独立注意力块模型目前带来过高的延迟开销。我们的实验得出结论:当前视频Transformer尚不能在与传统卷积基线相当的轻量级动作识别上胜任,需解决前述缺陷以弥合差距。复现实验的代码将公开提供。
引用
@article{arxiv.2111.09641,
title = {Evaluating Transformers for Lightweight Action Recognition},
author = {Raivo Koot and Markus Hennerbichler and Haiping Lu},
journal= {arXiv preprint arXiv:2111.09641},
year = {2021}
}
备注
pre-print