DINOv3 视觉表征用于蓝莓感知以实现机器人采收
计算机视觉与模式识别
2026-03-10 v2
摘要
通过大规模自监督学习训练的视觉基础模型在视觉感知方面显示出强大的泛化能力;然而,它们在农业场景中的实际作用和性能限制尚不充分了解。本工作评估 DINOv3 作为蓝莓机器人采收相关视觉任务的冻结主干网络,包括水果和损伤分割以及水果和簇检测。在统一的协议下使用轻量解码器时,分割任务始终受益于稳定的 patch 级表征且随主干规模而扩展。相比之下,检测受目标尺度变化、patch 离散化以及局域性兼容性的限制。簇检测的失败凸显了在空间聚合结构中建模关系目标的局限性。总体而言,DINOv3 最好看作一种语义主干,其有效性取决于与水果尺度和聚合结构相匹配的下游空间建模,为蓝莓机器人采收提供指导。代码和数据集将在接受后公开。
引用
@article{arxiv.2603.02419,
title = {DINOv3 Visual Representations for Blueberry Perception Toward Robotic Harvesting},
author = {Rui-Feng Wang and Daniel Petti and Yue Chen and Changying Li},
journal= {arXiv preprint arXiv:2603.02419},
year = {2026}
}
备注
16 pages, 9 figures, 5 tables