中文

基于 3D 重建与知识蒸馏提升多视角图像模型以探索小麦穗体积估计

计算机视觉与模式识别 2026-05-21 v1

摘要

小麦穗体积的精确估计对于产量组成分析和抗逆性评估至关重要,但现场测量仍具有挑战性。主动 3D 探测方法,如激光雷达(LiDAR)或时间飞行(ToF),对植物运动敏感,或不适用于户外环境,而 3D 重建计算成本高昂。直接的 2D 图像处理将提供计算优势,但基于图像的模型缺乏显式的几何信息。因此,我们提出一种在训练期间进行知识蒸馏、同时实现高效图像唯一推断的混合 2D-3D 方法。首先,我们使用基于距离的直方图特征训练一个刚性不变点云网络,以获得具备姿态鲁性的几何表示。随后,我们将该 3D 模型与提出的多视角图像基准 Transformer(RT)组合构建集成架构。最后,我们通过基于特征或基于标签的蒸馏将集成知识蒸馈到纯粹基于图像的学生模型中。两种蒸馏后的 RT 均将非蒸馏 RT 的平均绝对误差(MAE)从 654.31 mm3^3 降至 639.93 mm3^3 和 644.62 mm3^3,并将相关系数提升至 0.77 和 0.82。同时,推断时间从每根穗 160 ms 降至 1.4 ms。蒸馏进一步减轻了体积相关偏差,并将图像模型的潜在表示塑造成几何感知的形状。我们的结果表明,3D 信息训练的 2D Transformer 允许对高通量田间表型实现可扩展且高效的穗体积估计。

关键词

引用

@article{arxiv.2605.20940,
  title  = {3D Reconstruction and Knowledge Distillation to Improve Multi-View Image Models to Explore Spike Volume Estimation in Wheat},
  author = {Olivia Zumsteg and Jannis Widmer and Yann Bourdé and Norbert Kirchgessner and Andreas Hund and Lukas Roth and Paraskevi Nousi},
  journal= {arXiv preprint arXiv:2605.20940},
  year   = {2026}
}

备注

8 pages, 6 figures (Appendix: 4 pages, 5 figures)