中文

使用 LLM 生成数据集进行零样本自动标注与实例分割:消除深度学习模型开发中的现场成像与人工标注

计算机视觉与模式识别 2025-03-03 v2 人工智能

摘要

目前,基于深度学习的各种应用(例如农业)实例分割主要通过劳动密集型过程进行,该过程涉及使用复杂传感器进行大量现场数据收集,然后对图像进行仔细的人工标注,这给研究人员和组织带来了巨大的后勤和财务挑战。该过程也减慢了模型开发和训练的速度。在本研究中,我们提出了一种用于商业果园中苹果实例分割的深度学习方法,该方法消除了对劳动密集型现场数据收集和人工标注的需求。利用大型语言模型(LLM),我们合成了果园图像,并使用与 YOLO11 基础模型集成的 Segment Anything Model(SAM)自动对其进行标注。这种方法显著减少了对物理传感器和人工数据处理的依赖,代表了“农业人工智能”的重大进步。合成的自动标注数据集被用于训练用于苹果实例分割的 YOLO11 模型,然后在真实的果园图像上进行了验证。结果表明,自动生成的标注达到了 0.9513 的 Dice 系数和 0.9303 的 IoU,验证了掩码标注的准确性和重叠度。所有仅在这些带有自动标注的合成数据集上训练的 YOLO11 配置,都能准确识别和描绘苹果,突显了该方法的有效性。具体来说,YOLO11m-seg 配置在从商业果园收集的测试图像上达到了 0.902 的掩码精度和 0.833 的掩码 mAP@50。此外,YOLO11l-seg 配置在对 40 张 LLM 生成图像的验证中优于其他模型,达到了最高的掩码精度和 mAP@50 指标。

关键词

引用

@article{arxiv.2411.11285,
  title  = {Zero-Shot Automatic Annotation and Instance Segmentation using LLM-Generated Datasets: Eliminating Field Imaging and Manual Annotation for Deep Learning Model Development},
  author = {Ranjan Sapkota and Achyut Paudel and Manoj Karkee},
  journal= {arXiv preprint arXiv:2411.11285},
  year   = {2025}
}