生成性指标是否预测 YOLO 性能?在模型、数据增强比例和数据集复杂度下的评估
计算机视觉与模式识别
2026-02-24 v1 机器学习
摘要
合成图像日益增多地用于增强目标检测训练集,但在训练前可靠地评估合成数据集仍然困难:标准的全局生成性指标(如 FID)通常无法预测下游检测的 mAP。我们对合成数据增强在 YOLOv11 上的表现进行了受控评估,涵盖三个单类检测场景——交通标志(稀疏/接近饱和)、城市景观行人(密集/遮挡严重)以及 COCO PottedPlant(多实例/高变异)。我们对比六种基于 GAN、扩散和混合方法的生成器,在数据增强比例从 10% 到 150% 不等的真实训练集比例下进行测试,分别从零初始化和使用 COCO 预训练初始化进行训练,在保留的真实测试集上进行评估([email protected]:0.95)。对于每个数据集-生成器-数据增强配置,我们采用匹配大小的自助抽样协议计算预训练数据集指标,包括(i)基于 Inception-v3 和 DINOv2 嵌入的全局特征空间指标,以及(ii)基于边界框统计量的对象中心分布距离。合成数据增强在更具挑战性的场景中显著提升性能(在行人和盆栽植物场景中分别提升了最高达 +7.6% 和 +30.6% 的相对 mAP),但在交通标志场景中和使用预训练微调时效果有限。为将指标信号与数据增强数量分离,我们报告了原始关联和在控制数据增强水平后的残差化相关性(并进行多重检验校正),显示指标与性能的关联在不同场景下strongly依赖,且许多看似的原始关联在控制增强水平后会减弱。
引用
@article{arxiv.2602.18525,
title = {Do Generative Metrics Predict YOLO Performance? An Evaluation Across Models, Augmentation Ratios, and Dataset Complexity},
author = {Vasile Marian and Yong-Bin Kang and Alexander Buddery},
journal= {arXiv preprint arXiv:2602.18525},
year = {2026}
}
备注
23 pages, 13 figures, includes appendix