中文

LAF-YOLOv10:结合部分卷积骨干网络、注意力引导特征金字塔、辅助P2检测头和Wise-IoU损失的无人机航拍图像小目标检测

计算机视觉与模式识别 2026-02-17 v1 机器学习

摘要

无人机作为监视、交通监控和灾难响应的主要传感平台,使得航拍目标检测成为应用计算机视觉中的一个核心问题。当前的检测器难以应对无人机特有的挑战:目标仅占几个像素、背景杂乱、严重遮挡以及严格的机载计算预算。本研究引入了 LAF-YOLOv10,它基于 YOLOv10n,集成了四种互补技术以改进无人机图像中的小目标检测。部分卷积 C2f (PC-C2f) 模块将空间卷积限制在骨干网络通道的四分之一,减少了冗余计算,同时保持了判别能力。注意力引导特征金字塔网络 (AG-FPN) 在多尺度融合前插入挤压激励通道门,并将最近邻上采样替换为 DySample 以实现内容感知插值。一个 160×160 分辨率的辅助 P2 检测头将定位扩展到 8×8 像素以下的目标,同时移除了 P5 检测头以重新分配参数。Wise-IoU v3 取代了 CIoU 用于边界框回归,减弱了拥挤航拍场景中噪声标注的梯度。这四个模块解决了非重叠的瓶颈:PC-C2f 压缩了骨干网络计算,AG-FPN 优化了跨尺度融合,P2 检测头恢复了空间分辨率,Wise-IoU 在标签噪声下稳定了回归。没有单个组件是新颖的;贡献在于在单个 YOLOv10 框架内的联合集成。在三次训练运行(种子 42、123、256)中,LAF-YOLOv10 在 VisDrone-DET2019 上以 2.3M 参数实现了 35.1±0.3% 的 [email protected],比 YOLOv10n 高出 3.3 个百分点。在 UAVDT 上的跨数据集评估产生了 35.8±0.4% 的 [email protected]。在 NVIDIA Jetson Orin Nano 上的基准测试确认了 FP16 下 24.3 FPS,证明了在嵌入式无人机部署中的可行性。

关键词

引用

@article{arxiv.2602.13378,
  title  = {LAF-YOLOv10 with Partial Convolution Backbone, Attention-Guided Feature Pyramid, Auxiliary P2 Head, and Wise-IoU Loss for Small Object Detection in Drone Aerial Imagery},
  author = {Sohail Ali Farooqui and Zuhair Ahmed Khan Taha and Mohammed Mudassir Uddin and Shahnawaz Alam},
  journal= {arXiv preprint arXiv:2602.13378},
  year   = {2026}
}