中文

D4:基于文本引导扩散模型的域自适应数据增强用于葡萄枝叶检测

计算机视觉与模式识别 2024-09-09 v1 人工智能 机器学习

摘要

在农业田间,利用目标检测模型进行植物表型识别正逐渐受到关注。然而,由于标注困难且领域多样性大,收集创建通用且高精度模型所需的训练数据的挑战极大。此外,跨作物 transferring 训练数据也十分困难,虽然已开发出针对特定环境、条件或作物的机器学习模型,但难以在实际田间广泛应用。本研究提出了一种用于葡萄枝叶检测的生成式数据增强方法(D4)。D4 采用基于大量来自无人地面车辆或其他方式收集的原始视频数据训练的预训练文本引导扩散模型,以及少量标注数据集。该方法生成带有目标域背景信息的新型标注图像,同时保留目标检测所必需的标注信息。此外,D4 克服了农业领域训练数据不足的问题,包括标注困难和领域多样性。我们确认,此生成式数据增强方法在葡萄枝叶检测的边界框检测任务中将平均平均精度提升至最高 28.65%,关键点检测任务中平均精度提升至最高 13.73%。我们的生成式数据增强方法 D4 有望同时解决农业训练数据生成的成本和领域多样性问题,并提高检测模型的泛化性能。

关键词

引用

@article{arxiv.2409.04060,
  title  = {D4: Text-guided diffusion model-based domain adaptive data augmentation for vineyard shoot detection},
  author = {Kentaro Hirahara and Chikahito Nakane and Hajime Ebisawa and Tsuyoshi Kuroda and Yohei Iwaki and Tomoyoshi Utsumi and Yuichiro Nomura and Makoto Koike and Hiroshi Mineno},
  journal= {arXiv preprint arXiv:2409.04060},
  year   = {2024}
}