超越 RGB:利用视觉 Transformer 进行热成像武器分割
摘要
热成像武器分割对于监视和安保应用至关重要,使系统能够在低光和视觉受阻 conditions 下实现稳健检测,其中基于 RGB 的系统会失败。虽然卷积神经网络 (CNNs) 在热成像分割文献中占据主导地位,但其捕获长程依赖和细节结构的能力有限。视觉 Transformer (ViT) 凭借其全局上下文建模能力,在 RGB 分割任务中取得了最新成果,但其在热成像武器分割中的潜力仍未得到充分探索。本工作适配并评估了四种基于 Transformer 的架构 SegFormer、DeepLabV3\+、SegNeXt 和 Swin Transformer,用于二分类武器分割,数据集包含 9,711 张实景监视视频自动使用 SAM2 标注的图像。我们在 MMSegmentation 框架中采用标准数据增强策略,以确保稳健的模型训练和公平的架构比较。实验结果显示分割性能显著提升:SegFormer-b5 实现最高的 mIoU (94.15\%) 和像素准确率 (97.04\%),而 SegFormer-b0 在竞争性的 mIoU (90.84\%) 下提供最快的推理速度 (98.32 FPS)。SegNeXt-mscans 在 85.12 FPS 和 92.24\% mIoU 之间提供均衡性能,DeepLabV3\+ R101-D8 在 29.86 FPS 达到 92.76\% mIoU。Transformer 架构在低光和受遮挡热环境中展现出鲁棒的泛化能力,灵活的精度-速度权衡适用于多样化的实时安保应用。
引用
@article{arxiv.2510.16912,
title = {Torsion points of small order on cyclic covers of $\mathbb P^1$. II},
author = {Boris Bekker and Yuri G. Zarhin},
journal= {arXiv preprint arXiv:2510.16912},
year = {2025}
}
备注
33 pages. We added results about torsion points over arbitrary infinite perfect fields, including the most interesting case of the field of rational numbers