中文

复杂果园环境中YOLOv8与Mask R-CNN实例分割对比

计算机视觉与模式识别 2025-10-06 v4

摘要

实例分割是农业自动化中的一项重要图像处理操作,能够精确描绘图像中的单个物体,并支持选择性收获和精准修剪等任务。本研究在两个数据集上,对比了单阶段YOLOv8模型与两阶段Mask R-CNN模型在不同果园条件下的实例分割性能。数据集1采集于休眠季,包含无叶苹果树的图像,用于训练描绘树枝和树干的多物体分割模型。数据集2采集于生长季早期,包含带有绿叶和未成熟苹果的冠层图像,用于训练描绘幼果的单物体分割模型。结果显示,在置信度阈值为0.5时,YOLOv8以更高的精确率和近乎完美的召回率优于Mask R-CNN。对于数据集1,YOLOv8的精确率为0.90,召回率为0.95,而Mask R-CNN分别为0.81和0.81。对于数据集2,YOLOv8的精确率达到0.93,召回率达到0.97,而Mask R-CNN分别为0.85和0.88。YOLOv8的推理时间也更短,分别为10.9毫秒和7.8毫秒,而Mask R-CNN为15.6毫秒和12.8毫秒。这些发现证明了YOLOv8在机器人收获和疏果等实时果园自动化任务中具有更高的准确性和效率。

关键词

引用

@article{arxiv.2312.07935,
  title  = {Comparing YOLOv8 and Mask R-CNN for instance segmentation in complex orchard environments},
  author = {Ranjan Sapkota and Dawood Ahmed and Manoj Karkee},
  journal= {arXiv preprint arXiv:2312.07935},
  year   = {2025}
}