VTR:一种用于在 FPGA 上加速 SAR ATR 的优化 Vision Transformer
计算机视觉与模式识别
2024-04-09 v1 人工智能
硬件体系结构
分布式、并行与集群计算
摘要
合成孔径雷达 (SAR) 自动目标识别 (ATR) 是遥感图像识别等军事应用中的关键技术。Vision Transformer (ViT) 是当前各种计算机视觉应用中的 state-of-the-art,性能优于其对应的 CNN。然而,将 ViT 用于 SAR ATR 应用具有挑战性,原因在于:(1) 标准 ViT 由于局部性低,需要大量训练数据才能良好泛化;然而,标准 SAR 数据集的标注训练数据数量有限,这降低了 ViT 的学习能力;(2) ViT 参数量大且计算密集,使其难以部署在资源受限的 SAR 平台上。在本研究中,我们利用 Shifted Patch Tokenization (SPT) 和 Locality Self-Attention (LSA) 模块,开发了一种可以直接在小数据集上训练而无需任何预训练的轻量级 ViT 模型。我们直接在训练样本有限的 SAR 数据集上训练该模型,以评估其在 SAR ATR 应用中的有效性。我们在三个广泛使用的 SAR 数据集:MSTAR、SynthWakeSAR 和 GBSAR 上评估了我们提出的模型,我们将其称为 VTR (ViT for SAR ATR)。此外,为了实现实时 SAR ATR 应用的部署,我们提出了一种新颖的 VTR FPGA 加速器。
引用
@article{arxiv.2404.04527,
title = {VTR: An Optimized Vision Transformer for SAR ATR Acceleration on FPGA},
author = {Sachini Wickramasinghe and Dhruv Parikh and Bingyi Zhang and Rajgopal Kannan and Viktor Prasanna and Carl Busart},
journal= {arXiv preprint arXiv:2404.04527},
year = {2024}
}
备注
SPIE DCS 2024