基于生物视觉系统启发的线索的单目深度估计
计算机视觉与模式识别
2022-05-13 v2
摘要
单目深度估计(MDE)旨在将场景的RGB图像转换为同一相机视角下的逐像素深度图。由于信息缺失,该问题本质上是病态的:任何单张图像都可能来自多种可能的3D场景。因此,MDE任务的一部分在于学习图像中哪些视觉线索可用于深度估计,以及如何利用它们。在标注成本限制训练数据或计算能力限制网络容量的情况下,这是具有挑战性的。在本工作中,我们证明将视觉线索信息显式注入模型有益于深度估计。遵循对生物视觉系统的研究,我们聚焦于语义信息以及物体尺寸及其关系的先验知识,以模拟相对大小、熟悉大小和绝对大小等生物线索。我们使用最先进的语义与实例分割模型提供外部信息,并利用语言嵌入编码类别间的关系信息。我们还提供了物体平均真实尺寸的先验。该外部信息克服了数据可用性的限制,并确保给定网络的有限容量集中于已知有用的线索,从而提升性能。我们通过实验验证了假设,并在广泛使用的NYUD2室内深度估计基准上评估了所提模型。结果表明,当语义信息、尺寸先验和实例尺寸与RGB图像一同显式提供时,深度预测有所改善,且我们的方法可轻松适配任意深度估计系统。
引用
@article{arxiv.2204.10384,
title = {Monocular Depth Estimation Using Cues Inspired by Biological Vision Systems},
author = {Dylan Auty and Krystian Mikolajczyk},
journal= {arXiv preprint arXiv:2204.10384},
year = {2022}
}
备注
7 pages, 2 figures. Accepted to International Conference on Pattern Recognition (ICPR) 2022. Code available at https://github.com/DylanAuty/MDE-biological-vision-systems