LL-ViT:基于查表神经元的边缘可部署视觉变换器
机器学习
2026-02-09 v1 计算机视觉与模式识别
摘要
视觉变换器在计算机视觉任务中取得了巨大成功。然而,其大的计算、内存和能源需求是面向 FPGA 边缘推理的挑战,这一领域近期需求激增。我们认识到逻辑和查表(LUT)基于网络(如 LogicNets、NeuraLUT、DWN 等)的优势,能够同时降低内存和计算占用。然而,这些模型在常规视觉任务(如 CIFAR-10/100)上原生表现不佳。本文提出LL-ViT,这是一种新型边缘优化视觉变换器设计,将 LUT 神经元层集成到变换器架构中。基于我们揭示的表征表明,大部分模型权重和计算来自通道混合器(MLP 层),我们设计了替代性的 LUT 基于通道混合器,同时开发了用于 LL-ViT 的 FPGA 加速器。与某些尝试将每个乘法替换为查表不同,我们的架构利用神经学习方法原生学习 LUT 函数。这种方法允许模型大小缩减,为视觉变换器模型提供高效的计算和能源解决方案。在边缘合适的工作负载上,我们在 CIFAR-10 上实现了95.5%的准确率,在 CIFAR-100 上达到78.8%,在 Tiny-ImageNet 上达到60.9%,性能相当于基准变换器。LL-ViT 消除超过60%的模型权重和50%的乘法运算,相对于整数量化 ViT 加速器实现1.9倍能源效率和1.3倍延迟降低,同时在10.9W功率预算下还能在吞吐量方面优于先前工作。
引用
@article{arxiv.2511.00812,
title = {LL-ViT: Edge Deployable Vision Transformers with Look Up Table Neurons},
author = {Shashank Nag and Alan T. L. Bacellar and Zachary Susskind and Anshul Jha and Logan Liberty and Aishwarya Sivakumar and Eugene B. John and Krishnan Kailas and Priscila M. V. Lima and Neeraja J. Yadwadkar and Felipe M. G. Franca and Lizy K. John},
journal= {arXiv preprint arXiv:2511.00812},
year = {2026}
}
备注
Accepted for FPT 2025, 9 pages, conference