中文

PatchNet——用于高效视频处理的短程模板匹配

计算机视觉与模式识别 2021-03-15 v1 人工智能

摘要

目标识别是许多视频处理任务中的基础问题,以低计算成本精确锁定已见物体为设备端视频识别铺平了道路。我们提出 PatchNet,一种高效卷积神经网络,用于在相邻视频帧中匹配物体。它学习块级相关特征而非像素特征。PatchNet 非常紧凑,仅以 58MFLOPs 运行,比 MobileNetV2 简单 5×5\times。我们展示了其在两项任务上的应用:视频目标检测与视觉目标跟踪。在 ImageNet VID 上,PatchNet 将 R-FCN ResNet-101 的浮点运算量降低 5 倍,将 EfficientDet-D0 降低 3.4 倍,且 mAP 损失小于 1%。在 OTB2015 上,PatchNet 将 SiamFC 和 SiamRPN 降低 2.5 倍且无精度损失。在 Jetson Nano 上的实验进一步展示了与浮点运算量减少相关的 2.8 倍至 4.3 倍加速。代码开源于 https://github.com/RalphMao/PatchNet。

关键词

引用

@article{arxiv.2103.07371,
  title  = {PatchNet -- Short-range Template Matching for Efficient Video Processing},
  author = {Huizi Mao and Sibo Zhu and Song Han and William J. Dally},
  journal= {arXiv preprint arXiv:2103.07371},
  year   = {2021}
}