DepthFocus:可控的视距场景深度估计
计算机视觉与模式识别
2026-03-26 v3
摘要
现实世界中的深度从来不是单一的。透明材料创建的层叠歧义会干扰常规感知系统。现有模型保持被动状态;常规方法通常估计静态深度图,锚定最近表面;即便是最新的多头扩展方案,因固定特征表示仍受表征瓶颈。这与人类视觉形成鲜明对比——后者主动转移焦点以感知所需深度。我们提出DepthFocus(深度聚焦),一种可导引的Vision Transformer,重新定义立体深度估计为条件感知控制。不同于提取固定特征,本模型依据物理参考深度动态调制其计算过程,集成双重条件机制,以选择性地感知与所需焦点相吻合的几何结构。借助新编的大规模合成数据集,DepthFocus在所有评估基准上实现最先进成绩,涵盖常规单层及复杂多层场景。虽保持不透明区域的高精度,本方法有效解决透明和反射场景中的深度歧义,通过选择性重建目标距离处的几何结构。该能力实现意图驱动的感知,显著优于现有多层方法,标志着主动3D感知的重要进展。\noindent \textbf{项目页面}:\href{https://junhong-3dv.github.io/depthfocus-project/}{\textbf{此链接}}。
引用
@article{arxiv.2511.16993,
title = {DepthFocus: Controllable Depth Estimation for See-Through Scenes},
author = {Junhong Min and Jimin Kim and Minwook Kim and Cheol-Hui Min and Youngpil Jeon and Minyong Choi},
journal= {arXiv preprint arXiv:2511.16993},
year = {2026}
}
备注
8pages, 5 figures, 5 tables