中文

evMLP:面向视觉的高效事件驱动MLP架构

计算机视觉与模式识别 2025-11-13 v2

摘要

深度神经网络在计算机视觉任务中取得了显著成果。早期主流的架构是卷积神经网络(CNN)。近年来,视觉Transformer(ViT)越来越受欢迎。此外,探索多层感知器(MLP)的应用为视觉模型架构研究提供了新视角。本文提出evMLP并配以简单事件驱动的局部更新机制。 proposed evMLP通过MLP独立处理图像或特征图上的标记。我们将连续帧之间的变化定义为“事件”。在事件驱动的局部更新机制下,evMLP仅对发生事件的标记进行选择性处理。对于顺序图像数据(如视频处理),此方法通过避免冗余计算来提高计算性能。在ImageNet图像分类实验中,evMLP达到了与最先进模型相当的准确率。更重要的是,多个视频数据集上的实验表明,evMLP通过其事件驱动的局部更新机制在保持与非事件驱动基线输出一致性的同时,降低了计算成本。代码和预训练模型均可在https://github.com/i-evi/evMLP获取。

关键词

引用

@article{arxiv.2507.01927,
  title  = {evMLP: An Efficient Event-Driven MLP Architecture for Vision},
  author = {Zhentan Zheng},
  journal= {arXiv preprint arXiv:2507.01927},
  year   = {2025}
}