用于从地面图像直接估计葡萄产量的端到端深度学习
计算机视觉与模式识别
2022-08-05 v1
摘要
产量估计是葡萄园管理中的有力工具,因为它使种植者能够微调管理措施以优化产量与品质。然而,目前的产量估计采用人工采样,耗时且不精确。本研究展示了近景成像结合深度学习用于葡萄园产量估计的应用。使用车载传感套件进行连续数据采集,并在收获时利用商业产量监测仪收集真值产量数据,从而生成了包含 23,581 个产量点和 107,933 张图像的大规模数据集。此外,本研究在一个机械管理的商业葡萄园中进行,这代表了图像分析的挑战性环境,但也是加利福尼亚中央山谷的常见条件。测试了三种模型架构:目标检测、CNN 回归和 transformer 模型。目标检测模型在手标图像上训练以定位葡萄串,并将串计数或像素面积求和以与葡萄产量相关联。相反,回归模型以端到端方式训练,从图像数据预测葡萄产量,无需手标。结果表明,在具有代表性的留出数据集上,transformer 以及采用像素面积处理的目标检测模型表现相当,平均绝对百分比误差分别为 18% 和 18.5%。显著性映射用于证明 CNN 模型的注意力集中在葡萄串的预测位置附近以及葡萄藤冠层顶部。总体而言,该研究显示了近景成像和深度学习在大规模葡萄藤产量预测中的适用性。此外,端到端建模方法在消除手标需求的同时,能够达到与目标检测方法相当的性能。
引用
@article{arxiv.2208.02394,
title = {End-to-end deep learning for directly estimating grape yield from ground-based imagery},
author = {Alexander G. Olenskyj and Brent S. Sams and Zhenghao Fei and Vishal Singh and Pranav V. Raja and Gail M. Bornhorst and J. Mason Earles},
journal= {arXiv preprint arXiv:2208.02394},
year = {2022}
}