中文

使用随机森林进行棉花产量预测

机器学习 2023-12-06 v1 计算机与社会 应用统计

摘要

美国棉花产业致力于可持续的生产实践,旨在最大限度地减少水、土地和能源的使用,同时改善土壤健康并提高棉花产量。气候智慧型农业技术正在被开发,以提高产量并降低运营成本。然而,由于品种、土壤类型、管理、病虫害、气候和天气模式对农作物的复杂且非线性的影响,农作物产量预测具有挑战性。为了解决这个问题,我们采用机器学习(Machine Learning, ML)在考虑气候变化、土壤多样性、品种和无机氮水平的情况下预测产量。从 20 世纪 80 年代到 90 年代,在美国南部棉花带收集了田间数据。为了捕捉过去六年气候变化的最当前影响,利用基于过程的作物模型 GOSSYM 生成了第二个数据源。我们将精力集中在三个南部州(德克萨斯州、密西西比州和佐治亚州)各自内部的三个不同区域。为了简化计算量,将每组实验数据的累积热单位(Accumulated Heat Units, AHU)用作利用时间序列天气数据的类比。Random Forest Regressor 达到了 97.75% 的准确率,均方根误差为 55.05 kg/ha,R2 约为 0.98。这些发现表明,可以开发并应用一种 ML 技术作为可靠且易于使用的模型,以支持棉花气候智慧型倡议。

关键词

引用

@article{arxiv.2312.02299,
  title  = {Cotton Yield Prediction Using Random Forest},
  author = {Alakananda Mitra and Sahila Beegum and David Fleisher and Vangimalla R. Reddy and Wenguang Sun and Chittaranjan Ray and Dennis Timlin and Arindam Malakar},
  journal= {arXiv preprint arXiv:2312.02299},
  year   = {2023}
}

备注

6 pages, 2 figures, 3 tables