中文

数据集标准化与集中化以实现农业深度学习模型的高效训练

计算机视觉与模式识别 2022-08-05 v1

摘要

近年来,深度学习模型已成为农业计算机视觉的标准。此类模型通常使用最初拟合于更通用的非农业数据集的模型权重,针对农业任务进行微调。这种缺乏农业特定微调的做法可能增加训练时间与资源消耗,并降低模型性能,导致数据效率整体下降。为克服该局限,我们收集了针对三个不同任务的广泛现有公共数据集,对其标准化,并构建标准训练与评估流程,从而提供一组基准与预训练模型。随后,我们使用深度学习任务中常用但在农业领域特定应用中未经探索的方法进行了若干实验。我们的实验引导我们开发出多种在训练农业深度学习模型时提升数据效率的方法,而无需对现有流程进行大规模修改。我们的结果表明,即便是轻微的训练修改,例如使用农业预训练模型权重,或将特定空间增强引入数据处理流程,也能显著提升模型性能并缩短收敛时间,节省训练资源。此外,我们发现即便使用低质量标注训练的模型也能产生与高质量标注等效模型相当的性能,表明劣质标注数据集仍可用于训练,从而扩展了当前可用数据集的范围。我们的方法广泛适用于农业深度学习,并展现出显著提升数据效率的潜力。

关键词

引用

@article{arxiv.2208.02707,
  title  = {Standardizing and Centralizing Datasets to Enable Efficient Training of Agricultural Deep Learning Models},
  author = {Amogh Joshi and Dario Guevara and Mason Earles},
  journal= {arXiv preprint arXiv:2208.02707},
  year   = {2022}
}