DepthAgent:通过样本级专家选择实现更通用的深度估计
计算机视觉与模式识别
2026-05-25 v1
摘要
单眼度量深度估计通过大规模训练和通用相机建模取得了显著进展,但在多样化的相机设置(如透视、鱼眼和全景图像)下实现鲁健性部署仍具有挑战。现有方法通常依赖单一深度估计器,忽视了不同模型在不同输入域中编码不同相机假设并表现最佳的事实。在本文中,我们表明深度专家在样本级具有强大的互补性:模型偏好与相机几何高度相关,多模型融合在单个专家不可靠的困难样本上获得最大提升。基于这些观察,我们提出了 \textbf{\ours},一个面向自适应单眼深度估计的视觉语言智能体。DepthAgent 将现有的深度模型视为冻结的工具,学习分析场景和相机线索,通过多轮工具调用调用合适的专家,并为每个输入选择或融合其预测。为优化这种离散决策以实现稠密几何质量,我们设计了一种多奖励强化微调方案,联合鼓励有效的工具执行、场景/相机分析、专家选择质量和推理效率。广泛的实验在透视、鱼眼和全景基准测试上表明,\ours consistently 优于单个专家、固定模型融合和不同的选择策略,在困难样本上实现显著提升,凸显了专家选择和融合的关键作用。代码和模型将在发表后发布。
引用
@article{arxiv.2605.23281,
title = {DepthAgent: Towards Better Universal Depth Estimation via Sample-wise Expert Selection},
author = {Jie Zhu and Girish Chandar Ganesan and Xiaoming Liu},
journal= {arXiv preprint arXiv:2605.23281},
year = {2026}
}