DDD:植物病害诊断的判别难度距离
计算机视觉与模式识别
2025-01-03 v1 机器学习
摘要
近期研究表明,使用机器学习(ML)进行植物病害诊断时,存在因数据分区不当导致诊断性能被高估的问题,即训练和测试数据集来自同一来源(域)。植物病害诊断作为一种细粒度分类任务,具有其独特特征:症状模糊,且同一域内图像特征存在广泛变异性。在本研究中,我们提出了判别难度距离(Discriminative Difficulty Distance, DDD)的概念,这是一种新型度量,旨在量化训练数据集与测试数据集之间的域间差距,同时评估测试数据的分类难度。DDD为识别训练数据中缺乏多样性提供了有价值的工具,从而支持开发更具多样性和鲁棒性的数据集。我们调查了多个在不同数据集上训练的图像编码器,检验使用这些编码器生成的低维表示所测量的数据集之间的距离,是否适合作为DDD度量。该研究利用244,063张覆盖四种作物和34个病害类的植物病害图像,收集自27个域。结果表明,即使测试图像来自与用于训练编码器的不同作物或病害,纳入其中仍可构建一种强烈关联于独立开发的疾病分类器所指示诊断难度的数据集距离度量。与仅在ImageNet21K上预训练的基准编码器相比,相关性提高了0.106至0.485,最高可达0.909。
引用
@article{arxiv.2501.00734,
title = {DDD: Discriminative Difficulty Distance for plant disease diagnosis},
author = {Yuji Arima and Satoshi Kagiwada and Hitoshi Iyatomi},
journal= {arXiv preprint arXiv:2501.00734},
year = {2025}
}
备注
8 pages, 2 figures, 3 tables. Accepted at 4th Annual AAAI Workshop on AI to Accelerate Science and Engineering (AI2ASE)