无姿态估计?没问题:基于姿态无关和实例感知的单目深度估计测试时适应方法
计算机视觉与模式识别
2025-11-10 v1 人工智能
摘要
单目深度估计(MDE)是指从单一 RGB 图像中推断像素级深度的技术,在诸多需要三维(3D)场景地形的 AI 应用中发挥着关键且核心的作用。在实际场景中,MDE 模型往往需要部署在与训练条件不同的环境中。测试时域适应(TTA)是一种具有吸引力和实际意义的解决方法。虽然近期在 MDE 的 TTA 方面取得了显著进展,尤其是以自监督方式,但现有方法在应对多样化和动态环境时仍显不足。为突破这一难题,本文提出一种新型高性能 TTA 框架,命名为 PITTA。我们的方法包含两个关键创新策略:(i) 针对 MDE 的姿态无关 TTA 范式;(ii) 实例感知图像遮蔽。具体而言,PITTA 能够在不依赖任何相机姿态信息的情况下,对预训练的 MDE 网络实现高效的姿态无关 TTA。此外,我们的实例感知遮蔽策略通过去除包括背景组件在内的静态对象,从预训练的全景分割网络生成的分割掩码中提取动态对象(如车辆、行人等)的实例级掩码。为进一步提升性能,我们还提出一种简单且有效的单目图像(即单一 RGB 图像)和深度图的边缘提取方法。广泛的实验评估表明,在变化环境条件下的 DrivingStereo 和 Waymo 数据集上,所提框架 PITTA 在 MDE 的 TTA 中超越了现有最先进技术,取得了显著的性能提升。
引用
@article{arxiv.2511.05055,
title = {No Pose Estimation? No Problem: Pose-Agnostic and Instance-Aware Test-Time Adaptation for Monocular Depth Estimation},
author = {Mingyu Sung and Hyeonmin Choe and Il-Min Kim and Sangseok Yun and Jae Mo Kang},
journal= {arXiv preprint arXiv:2511.05055},
year = {2025}
}