中文

野外多模态疾病识别基准测试与通用基线

计算机视觉与模式识别 2024-08-07 v1

摘要

现有的植物病害分类模型在识别实验室病斑图像方面取得了显著成绩,但在对野外病斑图像进行分类时性能常显著下降。我们观察到,野外植物图像可能在 various 病害之间呈现相似外观(即小类别间差异),而同一病害可能看起来差异很大(即大类内差异)。因此,我们提出了一个野外植物病害识别数据集,包含最多的病害类别,同时为每种病害提供文本描述。特别地,新提供的文本描述通过文本模态提供丰富信息,帮助解决野外病害分类中小类别间差异和大类内差异的问题。因此,我们提出的数据集可被视为评估现实世界中疾病识别方法的理想测试平台。此外,我们进一步提出了一个强大且通用的基线模型,通过多个原型建模文本描述和视觉数据以适应给定类别。通过融合多模态原型的贡献进行分类,该基线模型能够有效解决小类别间差异和大类内差异的问题。值得注意的是,我们的基线模型不仅能进行疾病分类,还能在 few-shot 或无训练场景下识别疾病。广泛的基准测试结果表明,我们提出的野外多模态数据集为植物病害识别任务带来了诸多新挑战,而未来的工作仍有很大的提升空间。

关键词

引用

@article{arxiv.2408.03120,
  title  = {Benchmarking In-the-wild Multimodal Disease Recognition and A Versatile Baseline},
  author = {Tianqi Wei and Zhi Chen and Zi Huang and Xin Yu},
  journal= {arXiv preprint arXiv:2408.03120},
  year   = {2024}
}