PatchNet——用于高效视频处理的短程模板匹配
计算机视觉与模式识别
2021-03-15 v1 人工智能
摘要
目标识别是许多视频处理任务中的基础问题,以低计算成本精确锁定已见物体为设备端视频识别铺平了道路。我们提出 PatchNet,一种高效卷积神经网络,用于在相邻视频帧中匹配物体。它学习块级相关特征而非像素特征。PatchNet 非常紧凑,仅以 58MFLOPs 运行,比 MobileNetV2 简单 。我们展示了其在两项任务上的应用:视频目标检测与视觉目标跟踪。在 ImageNet VID 上,PatchNet 将 R-FCN ResNet-101 的浮点运算量降低 5 倍,将 EfficientDet-D0 降低 3.4 倍,且 mAP 损失小于 1%。在 OTB2015 上,PatchNet 将 SiamFC 和 SiamRPN 降低 2.5 倍且无精度损失。在 Jetson Nano 上的实验进一步展示了与浮点运算量减少相关的 2.8 倍至 4.3 倍加速。代码开源于 https://github.com/RalphMao/PatchNet。
引用
@article{arxiv.2103.07371,
title = {PatchNet -- Short-range Template Matching for Efficient Video Processing},
author = {Huizi Mao and Sibo Zhu and Song Han and William J. Dally},
journal= {arXiv preprint arXiv:2103.07371},
year = {2021}
}