中文

面向空间安全与可持续性的感知:基于视觉Transformer的深度学习方法

计算机视觉与模式识别 2024-12-17 v2 图像与视频处理

摘要

低地球轨道上以小卫星为代表的空间资产快速增长,可为所有人赋能无处不在的数字服务。然而,动态的空间环境、众多的空间物体、复杂的大气条件以及突发事件,都容易引入不利条件,影响空间安全、运行以及外层空间环境的可持续性。这要求具备响应迅速、有效的卫星目标检测(SOD)解决方案,使小卫星能够评估和应对碰撞风险,同时需考虑小卫星平台资源受限的约束。本文讨论了SOD任务及星上深度学习(DL)方法。我们提出了两种新的深度学习模型,即GELAN-ViT和GELAN-RepViT,它们将视觉Transformer(ViT)集成到高效层聚合网络(GELAN)架构中,并通过分离卷积神经网络和ViT路径来解决现有局限。在平均精度均值(mAP)和计算成本方面,这些模型优于最先进的YOLOv9-t。在SOD数据集上,我们提出的模型可实现约95%的mAP50,同时将十亿次浮点运算(GFLOPs)降低超过5.0。在VOC 2012数据集上,它们可实现≥60.7%的mAP50,同时GFLOPs降低超过5.2。

关键词

引用

@article{arxiv.2412.08913,
  title  = {Sensing for Space Safety and Sustainability: A Deep Learning Approach with Vision Transformers},
  author = {Wenxuan Zhang and Peng Hu},
  journal= {arXiv preprint arXiv:2412.08913},
  year   = {2024}
}

备注

To be published in the 12th Annual IEEE International Conference on Wireless for Space and Extreme Environments (WiSEE 2024)