利用三维作物模型与GAN实现数据更高效且泛化性更强的果实检测
计算机视觉与模式识别
2021-08-31 v1 人工智能
摘要
训练真实世界的神经网络模型以实现高性能与强泛化能力,通常需要大量涵盖广泛变化的标注数据。这一数据标注过程往往耗费大量人力与成本。为获得理想的预测性能,训练好的模型通常应用于数据分布与训练集相似的区域。然而,对于许多农业机器学习问题,训练数据集是在特定地点、生长季的特定时段采集的。由于农业系统在作物类型、品种、管理方式、季节性生长动态、光照条件、传感器类型等方面表现出显著变异性,基于某一数据集训练的模型往往难以跨域良好泛化。为使农业领域的神经网络模型更具数据效率与泛化能力,我们提出一种方法,将合成三维作物模型域中的照片级真实感农业图像生成至真实世界作物域。该方法采用语义约束的GAN(生成对抗网络)以保留果实位置与几何结构。我们观察到,基线CycleGAN方法能生成视觉真实的目标域图像,但无法保留果实位置信息,而我们的方法能很好地保持果实位置。在葡萄园昼夜图像生成任务中,我们的网络视觉输出明显优于基线网络。葡萄园葡萄检测任务中的增量训练实验表明,我们的方法生成的图像能显著加速域适应过程,在给定标注图像数量下提升性能(即数据效率),并降低标注需求。
引用
@article{arxiv.2108.13344,
title = {Enlisting 3D Crop Models and GANs for More Data Efficient and Generalizable Fruit Detection},
author = {Zhenghao Fei and Alex Olenskyj and Brian N. Bailey and Mason Earles},
journal= {arXiv preprint arXiv:2108.13344},
year = {2021}
}