中文

VTR:一种用于在 FPGA 上加速 SAR ATR 的优化 Vision Transformer

计算机视觉与模式识别 2024-04-09 v1 人工智能 硬件体系结构 分布式、并行与集群计算

摘要

合成孔径雷达 (SAR) 自动目标识别 (ATR) 是遥感图像识别等军事应用中的关键技术。Vision Transformer (ViT) 是当前各种计算机视觉应用中的 state-of-the-art,性能优于其对应的 CNN。然而,将 ViT 用于 SAR ATR 应用具有挑战性,原因在于:(1) 标准 ViT 由于局部性低,需要大量训练数据才能良好泛化;然而,标准 SAR 数据集的标注训练数据数量有限,这降低了 ViT 的学习能力;(2) ViT 参数量大且计算密集,使其难以部署在资源受限的 SAR 平台上。在本研究中,我们利用 Shifted Patch Tokenization (SPT) 和 Locality Self-Attention (LSA) 模块,开发了一种可以直接在小数据集上训练而无需任何预训练的轻量级 ViT 模型。我们直接在训练样本有限的 SAR 数据集上训练该模型,以评估其在 SAR ATR 应用中的有效性。我们在三个广泛使用的 SAR 数据集:MSTAR、SynthWakeSAR 和 GBSAR 上评估了我们提出的模型,我们将其称为 VTR (ViT for SAR ATR)。此外,为了实现实时 SAR ATR 应用的部署,我们提出了一种新颖的 VTR FPGA 加速器。

关键词

引用

@article{arxiv.2404.04527,
  title  = {VTR: An Optimized Vision Transformer for SAR ATR Acceleration on FPGA},
  author = {Sachini Wickramasinghe and Dhruv Parikh and Bingyi Zhang and Rajgopal Kannan and Viktor Prasanna and Carl Busart},
  journal= {arXiv preprint arXiv:2404.04527},
  year   = {2024}
}

备注

SPIE DCS 2024