中文

用于高效视觉表示学习的轻量级像素差分网络

计算机视觉与模式识别 2024-02-02 v1

摘要

近期,在开发具有满意精度的轻量级深度神经网络(DNNs)方面已有大量努力,这使得 DNNs 在边缘设备上的普遍部署成为可能。开发紧凑且高效的 DNNs 的核心挑战在于如何平衡实现高精度与高效率这两个相互竞争的目标。在本文中,我们提出了两种新型卷积,分别称为 \emph{像素差分卷积(PDC)和二值 PDC(Bi-PDC)},它们具有以下优势:能够捕获高阶局部微分信息、计算高效,且能够与现有 DNNs 集成。基于 PDC 和 Bi-PDC,我们进一步提出了两种轻量级深度网络,分别命名为 \emph{像素差分网络(PiDiNet)}和 \emph{二值 PiDiNet(Bi-PiDiNet)},以针对包括边缘检测和目标识别在内的视觉任务学习高效且更准确的表示。在流行数据集(BSDS500、ImageNet、LFW、YTF \emph{等})上的大量实验表明,PiDiNet 和 Bi-PiDiNet 实现了最佳的精度-效率折衷。对于边缘检测,PiDiNet 是首个无需 ImageNet 即可训练的网络,并且在 BSDS500 上以 100 FPS 和 <<1M 参数量达到了人类水平的性能。对于目标识别,在现有的二值 DNNs 中,Bi-PiDiNet 在 ResNet18 上实现了最佳精度,并使计算成本降低了近 2×2\times。代码可在 \href{https://github.com/hellozhuo/pidinet}{https://github.com/hellozhuo/pidinet} 获取。

关键词

引用

@article{arxiv.2402.00422,
  title  = {Lightweight Pixel Difference Networks for Efficient Visual Representation Learning},
  author = {Zhuo Su and Jiehua Zhang and Longguang Wang and Hua Zhang and Zhen Liu and Matti Pietikäinen and Li Liu},
  journal= {arXiv preprint arXiv:2402.00422},
  year   = {2024}
}

备注

We design a novel lightweight convolutional operator for computer vision tasks. Both full-precision networks and BNNs are developed. Accepted by TPAMI