视觉原型条件焦点区域生成用于无人机目标检测
计算机视觉与模式识别
2026-04-06 v1
摘要
无人机(UAV)目标检测是一项关键但具有挑战性的任务,尤其在动态变化场景中面临标注训练数据有限的问题。布局到图像生成方法通过基于扩散模型合成标注图像,已被证明能有效提升检测精度。然而,它们经常产生伪影,尤其是在微小物体附近的布局边界处,从而严重限制了其性能。为解决这些问题,我们提出了 UAVGen,一个专为无人机目标检测定制的布局到图像生成框架。具体而言,UAVGen 设计了视觉原型条件扩散模型(VPC-DM),为每个类别构建代表性实例并将它们集成到潜在嵌入中以实现高保真目标生成。此外,引入焦点区域增强数据流水线(FRE-DP)以强调合成中物体集中的前景区域,并结合标签细化以纠正缺失、多余和对齐错误的生成。广泛的实验结果表明,我们的方法显著优于最先进方法,并在与不同检测器集成时持续提升精度。源代码已发布:https://github.com/Sirius-Li/UAVGen。
引用
@article{arxiv.2604.02966,
title = {Visual Prototype Conditioned Focal Region Generation for UAV-Based Object Detection},
author = {Wenhao Li and Zimeng Wu and Yu Wu and Zehua Fu and Jiaxin Chen},
journal= {arXiv preprint arXiv:2604.02966},
year = {2026}
}
备注
CVPR2026 Accepted