中文

基于 hls4ml 的自动驾驶汽车 FPGA 实时语义分割

计算机视觉与模式识别 2022-05-19 v1 硬件体系结构 机器学习 仪器与探测器 机器学习

摘要

在本文中,我们研究了现场可编程门阵列如何作为硬件加速器,用于与自动驾驶相关的实时语义分割任务。考虑 ENet 卷积神经网络架构的压缩版本,我们展示了在 Xilinx ZCU102 评估板上,使用不到 30% 的可用资源,实现了每张图像 4.9 毫秒延迟的全片上部署。当批量大小增加到十时,延迟降低到每张图像 3 毫秒,这对应于自动驾驶车辆同时接收来自多个摄像头输入的使用场景。我们证明,通过积极的滤波器缩减和异构量化感知训练,以及卷积层的优化实现,可以在保持 Cityscapes 数据集上准确率的同时,显著降低功耗和资源利用率。

关键词

引用

@article{arxiv.2205.07690,
  title  = {Real-time semantic segmentation on FPGAs for autonomous vehicles with hls4ml},
  author = {Nicolò Ghielmetti and Vladimir Loncar and Maurizio Pierini and Marcel Roed and Sioni Summers and Thea Aarrestad and Christoffer Petersson and Hampus Linander and Jennifer Ngadiuba and Kelvin Lin and Philip Harris},
  journal= {arXiv preprint arXiv:2205.07690},
  year   = {2022}
}

备注

11 pages, 6 tables, 5 figures