基于CLIP引导的多任务回归用于多视角植物表型
计算机视觉与模式识别
2026-03-05 v1
摘要
建模植物生长动力学是现代农业研究的核心任务。然而,从多视角植物图像中学习稳健的预测器仍具有挑战,因为存在强烈的视角冗余和视角依赖的外观变化。我们提出了一个基于CLIP嵌入的层级感知视觉语言框架,联合预测植物年龄和叶数,使用基于CLIP嵌入的单一多任务模型。我们的方法将旋转视图聚合为角度不变的表征,并对视觉特征基于轻量级文本先验条件进行建模,以适应不完整或无序输入下的稳定预测。在GroMo25基准上,我们的方法将平均年龄MAE从7.74降低到3.91,将平均叶数MAE从5.52降低到3.08,分别实现了49.5%和44.2%的改进。统一的表述通过替换传统的双模型设置来简化管道,同时提高对缺失视角的鲁棒性。模型和代码可在:https://github.com/SimonWarmers/CLIP-MVP获取。
引用
@article{arxiv.2603.04091,
title = {CLIP-Guided Multi-Task Regression for Multi-View Plant Phenotyping},
author = {Simon Warmers and Muhammad Zawish and Fayaz Ali Dharejo and Steven Davy and Radu Timofte},
journal= {arXiv preprint arXiv:2603.04091},
year = {2026}
}
备注
Under review at IEEE Conference