中文

融合复杂度反转:为何更简单的跨视图模块在损伤估计中超过SSM和跨视图注意力Transformer

计算机视觉与模式识别 2026-05-08 v5 机器学习

摘要

准确估计来自农业影像的牧草生物量至关重要,但现有方法受限于现实监控中典型的小规模、不平衡且稀疏标注数据集。本研究系统评估了视觉基础模型适用于农业回归的适应性,在CSIRO牧草生物量基准数据集上进行测试,该数据集包含357张双视图图像,具有实验室验证的、按组成分的地面真实值,用于五个生物量目标。通过17种配置(涵盖EfficientNet-B3至DINOv3-ViT-L等四种主干网络、五种跨视图融合机制以及4×2元数据因子),发现了一个反直觉的原则,称为“融合复杂度反转”:在稀缺农业数据上,两层门控深度卷积(R² = 0.903)超过跨视图注意力Transformer(0.833)、双向SSM(0.819)和完整Mamba(0.793,低于无融合基线)。发现主干网络预训练规模在所有架构选择中占据主导地位,DINOv2→DINOv3升级alone可带来+5.0 R²分数。仅训练元数据(物种、状态和NDVI)可在R² ~ 0.829处创建通用底线,将8.4个融合分散度压缩到0.1个分散度。确立了稀缺农业基准的可操作指南:应优先考虑主干网络质量而非融合复杂度,优先选择局部模块而非全局模块,排除在推理时不可获得的特征。

关键词

引用

@article{arxiv.2603.07819,
  title  = {Fusion Complexity Inversion: Why Simpler Cross View Modules Outperform SSMs and Cross View Attention Transformers for Pasture Biomass Regression},
  author = {Mridankan Mandal},
  journal= {arXiv preprint arXiv:2603.07819},
  year   = {2026}
}

备注

Accepted to CVPR: Vision for Agriculture Workshop 2026 (Withdrawn)