DINOv3 meets YOLO26 用于蔬菜作物中的杂草检测
计算机视觉与模式识别
2026-03-03 v1 人工智能
摘要
开发精准蔬菜除草的鲁棒模型目前受限于大规模标注杂草作物数据集的稀缺。为解决这一限制,本研究提出一种通过整合异构数据集并利用自监督学习构建基础作物-杂草检测模型的方法。最初收集了 618,642 张作物-杂草图像,随后经过筛选得到 199,388 张用于微调 DINOv3 小型视觉转换器(ViT-small)的图像。随后将微调后的 DINOv3 主干网络集成到 YOLO26 中,用作主要主干或双主干架构的一部分。在双主干框架中引入特征对齐损失,以最小计算开销增强特征融合。实验结果显示,所提出的 DINOv3 微调 ViT-small 基于 YOLO26-large 的模型在 2025 季节收集的领域内图像上实现了最高可达 +5.4% 的 mAP50 提升。此外,它在 2021-2023 季节数据集上实现了 +14.0% 的跨域泛化 mAP50 提升,在 2024 季节数据集上实现了 +11.9% 的 mAP50 提升,相较于标准 YOLO26-large。虽然 DINOv3-YOLO26-large 模型参数增加 45.6%,推理延迟增加 2.9 倍,但仍保持约 28.5 帧/秒的实时性能。本研究策划的数据集和软件程序将向公众开放。
引用
@article{arxiv.2603.00160,
title = {DINOv3 Meets YOLO26 for Weed Detection in Vegetable Crops},
author = {Boyang Deng and Yuzhen Lu},
journal= {arXiv preprint arXiv:2603.00160},
year = {2026}
}
备注
10 pages, 2 figures