接纳有限且不完美的训练数据集:基于深度学习的植物病害识别中的机遇与挑战
计算机视觉与模式识别
2023-12-14 v2
摘要
深度学习的最新进展为植物病害识别带来了显著改进。然而,获得令人满意的性能通常需要高质量的训练数据集,而这类数据集的收集既困难又昂贵。因此,当前基于深度学习的模型在真实场景中的实际应用受限于高质量数据集的匮乏。在本文中,我们认为接纳劣质数据集是可行的,并旨在明确使用这些数据集所带来的挑战。为深入探讨该主题,我们分析了高质量数据集的特征,即大规模图像与期望标注,并将其与劣质数据集的\emph{有限}与\emph{不完美}性质进行对比。当训练数据集偏离这些特征时,挑战便随之产生。为提供全面理解,我们提出了一种新颖且具信息性的分类法,对这些挑战进行归类。此外,我们简要概述了应对这些挑战的现有研究与方法。我们相信,本文阐明了接纳劣质数据集的重要性,增进了对相关挑战的理解,并有助于在真实应用中部署这一雄心目标。为推动进展,我们最后描述了若干悬而未决的问题并指出潜在的未来方向。尽管我们的主要关注点是植物病害识别,但我们强调,接纳与分析劣质数据集的原则适用于更广泛领域,包括农业。
引用
@article{arxiv.2305.11533,
title = {Embrace Limited and Imperfect Training Datasets: Opportunities and Challenges in Plant Disease Recognition Using Deep Learning},
author = {Mingle Xu and Hyongsuk Kim and Jucheng Yang and Alvaro Fuentes and Yao Meng and Sook Yoon and Taehyun Kim and Dong Sun Park},
journal= {arXiv preprint arXiv:2305.11533},
year = {2023}
}
备注
revision v1 in perspetive style