微调视觉 Transformer 捕捉复杂小麦穗形态,用于 RGB 图像体积估计
计算机视觉与模式识别
2025-12-30 v2
摘要
从二维 RGB 图像估计三维形态特征(如体积)在实际条件下存在固有挑战,包括深度信息丢失、投影畸变和遮挡。本文探索了多种基于 RGB 图像的小麦穗非破坏性体积估计方法,并以结构光 3D 扫描作为基准参考。小麦穗体积在表型学中具有重要价值,因为其与穗干重高度相关,后者是果实效率的关键组成部分。针对穗的复杂几何形状,我们比较了不同神经网络方法用于从 2D 图像进行体积估计,并将其基准测试于两种常规方法:基于 2D 投影的面积估计和基于轴对齐截面的几何重建。采用 MLP 的微调视觉 Transformer(DINOv2 和 DINOv3)在六视图室内图像上实现最低的 MAPE 分别为 5.08% 和 4.67%,最高的相关系数为 0.96 和 0.97,优于微调的 CNN(ResNet18 和 ResNet50)、小麦专用主干网络以及两种基准方法。使用冻结的 DINO 主干时,深度监督的 LSTM 优于 MLP,而在微调后,改进的高级表征允许简单 MLP 超越 LSTM。我们展示了物体形状对体积估计精度具有显著影响,具有不规则几何形状的小麦穗对几何方法的挑战大于深度学习方法。将 DINOv3 在基于字段的单侧视图图像上进行微调可实现 MAPE 为 8.39% 且相关系数为 0.90,提供了一条新型管道和快速、准确、非破坏性的小麦穗体积表型方法。
引用
@article{arxiv.2506.18060,
title = {Fine-Tuned Vision Transformers Capture Complex Wheat Spike Morphology for Volume Estimation from RGB Images},
author = {Olivia Zumsteg and Nico Graf and Aaron Haeusler and Norbert Kirchgessner and Nicola Storni and Lukas Roth and Andreas Hund},
journal= {arXiv preprint arXiv:2506.18060},
year = {2025}
}
备注
18 pages, 22 figures