合成数据与标签分布对油菜分枝计数的影响
计算机视觉与模式识别
2026-07-10 v1
摘要
为自动化表型分析收集带注释的植物图像通常缓慢且昂贵。模拟生长和发育的植物模型可以生成具有精确标签的无限合成图像。然而,先前工作已确定,是否纳入合成数据能提高性能取决于合成图像与真实图像的比例以及合成数据集的标签分布。为系统量化这两个因素,我们使用校准的L系统植物模型,在油菜分枝计数任务上训练ResNet-18模型。我们独立变化每个因素。合成与真实比例为1:5至1:22时普遍提高性能;最佳比例(1:7)将平均绝对差比仅真实训练降低7.6%。对于标签分布,均匀合成分布强烈次优(绝对差约1.70);向真实分布插值90%得到绝对差0.927,而对真实标签分布进行高斯平滑得到总体最佳结果(绝对差0.912,比仅真实训练提高14.7%)。每个标签最少10张合成图像提供了更简单的替代方案,具有适度收益,而每个标签100张则过度校正并损害性能。
引用
@article{arxiv.2607.09630,
title = {The Effects of Synthetic Data and Label Distribution on Canola Branch Counting},
author = {Amirsalar Darvishpour and Mikolaj Cieslak and Adam Runions},
journal= {arXiv preprint arXiv:2607.09630},
year = {2026}
}
备注
5 pages, 4 figures, submitted to EPA 2026