中文

从地面到空中:基于事件相机的视觉Transformer与CNN的噪声鲁棒性研究,及其在无人机应用中的潜力

计算机视觉与模式识别 2025-06-30 v1 人工智能 机器学习

摘要

本研究探究了两种最相关的计算机视觉深度学习架构——卷积神经网络(CNN)和视觉Transformer(Vision Transformer)——在事件相机上的性能。与传统基于帧的相机不同,事件相机捕获场景变化,特别适用于无人机和自主车辆等动态环境。本文研究的深度学习模型为ResNet34和ViT B16,在GEN1事件相机数据集上进行微调。研究在标准条件下以及加入模拟噪声的情况下对这些模型进行评估和比较。对干净的GEN1数据集进行初始评估显示,ResNet34和ViT B16分别达到88%和86%的准确率,其中ResNet34在分类准确率上略占优势。然而,ViT B16模型表现出显著的鲁棒性,尤其考虑到其在更小数据集上的预训练。虽然本研究聚焦于基于地面的车辆分类,但该方法论及的发现在无人机语境中具有广泛的应用前景,包括空中目标分类和用于航空相关任务的事件视觉系统。

关键词

引用

@article{arxiv.2506.22360,
  title  = {From Ground to Air: Noise Robustness in Vision Transformers and CNNs for Event-Based Vehicle Classification with Potential UAV Applications},
  author = {Nouf Almesafri and Hector Figueiredo and Miguel Arana-Catania},
  journal= {arXiv preprint arXiv:2506.22360},
  year   = {2025}
}

备注

16 pages, 17 figures, 9 tables. To be presented in AIAA AVIATION Forum 2025