Iris:将语言集成到基于扩散的单目深度估计中
计算机视觉与模式识别
2025-11-19 v4 计算与语言
机器学习
多媒体
摘要
传统的单目深度估计存在固有的歧义和视觉杂散。我们展示了语言可以通过提供额外的条件(而不仅仅是图像)来增强单目深度估计,这些条件与合理的3D场景对齐,从而缩小深度估计的解空间。这种条件分布是在文本到图像预训练扩散模型期间学习的。为了生成各种视点和布局,以精确反映文本描述的图像,模型隐式地建模了物体的大小、形状和尺度、它们的空间关系以及整体场景结构。在本文中,我们提出了Iris,我们研究了将文本描述集成到扩散基于深度估计模型的训练和推理中的好处。我们实验了三种不同的扩散基于的单目深度估计器(Marigold、Lotus和E2E-FT)及其变体。在使用HyperSim和Virtual KITTI进行训练,在NYUv2、KITTI、ETH3D、ScanNet和DIODE上进行评估,我们发现我们的策略提高了整体单目深度估计的准确性,尤其在小区域效果更佳。它还提高了模型对文本描述的特定区域的深度感知。我们发现,通过在文本中提供更多细节,可以迭代细化深度预测。同时,我们发现语言可以作为约束来加速两者(训练和推理扩散轨迹)的收敛。代码和生成的文本数据将在接受后发布。
引用
@article{arxiv.2411.16750,
title = {Iris: Integrating Language into Diffusion-based Monocular Depth Estimation},
author = {Ziyao Zeng and Jingcheng Ni and Daniel Wang and Patrick Rim and Younjoon Chung and Fengyu Yang and Byung-Woo Hong and Alex Wong},
journal= {arXiv preprint arXiv:2411.16750},
year = {2025}
}