TSM:面向边缘设备高效可扩展视频理解的时间偏移模块
计算机视觉与模式识别
2021-09-28 v1 硬件体系结构
机器学习
摘要
视频流的爆炸式增长要求以高准确率和低计算成本进行视频理解。传统的2D CNN计算成本低但无法捕捉时间关系;基于3D CNN的方法可以取得良好性能但计算密集。在本文中,我们提出一个通用且高效的时间偏移模块(TSM),兼具高效率与高性能。TSM的核心思想是将部分通道沿时间维度偏移,从而促进相邻帧之间的信息交换。它可插入2D CNN中,以零计算和零参数实现时间建模。TSM具有若干独特优势。首先,TSM性能高;在提交时其在Something-Something排行榜上排名第一。其次,TSM效率高;在Jetson Nano和Galaxy Note8上实现在线视频识别的高帧率74fps和29fps。第三,与3D网络相比,TSM具有更高的可扩展性,能够在15分钟内于1,536块GPU上完成大规模Kinetics训练。最后,TSM支持动作概念学习,这是2D网络无法建模的;我们可视化类别注意力图,发现时空动作检测器在分类任务训练过程中浮现。代码公开于https://github.com/mit-han-lab/temporal-shift-module。
引用
@article{arxiv.2109.13227,
title = {TSM: Temporal Shift Module for Efficient and Scalable Video Understanding on Edge Device},
author = {Ji Lin and Chuang Gan and Kuan Wang and Song Han},
journal= {arXiv preprint arXiv:2109.13227},
year = {2021}
}
备注
Journal preprint of arXiv:1811.08383 (TPAMI, 2020). arXiv admin note: substantial text overlap with arXiv:1910.00932