STATIC: 用于视频单目深度估计的时间一致性的 Surface Temporal Affine
计算机视觉与模式识别
2025-11-14 v2
摘要
视频单目深度估计对于自动驾驶、AR/VR 和机器人等应用至关重要。最近的基于 Transformer 的单图像单目深度估计模型在单张图像上表现良好, 但在视频帧之间难以保持深度一致性。传统方法通过多帧时序模块或光流和相机参数等先验信息来提高时序一致性, 但面临高内存消耗、动态或不规则运动下性能下降以及运动理解有限等问题。我们提出 STATIC, 一个 novel 模型, 独立学习静态区域和动态区域的时序一致性, 无需额外信息。通过测量法线方向方差, 来自表面法线的差分掩码识别静态和动态区域。对于静态区域, Masked Static (MS) 模块通过聚焦稳定区域来增强时序一致性。对于动态区域, Surface Normal Similarity (SNS) 模块通过测量帧之间特征相似性来对齐区域并增强时序一致性。最终的细化整合独立学习的静态和动态区域, 使 STATIC 能够在整个序列上实现时序一致性。我们的方法在 KITTI 和 NYUv2 数据集上实现了无需额外信息的单目视频深度估计的最新性能。
引用
@article{arxiv.2412.01090,
title = {STATIC : Surface Temporal Affine for TIme Consistency in Video Monocular Depth Estimation},
author = {Sunghun Yang and Minhyeok Lee and Suhwan Cho and Jungho Lee and Sangyoun Lee},
journal= {arXiv preprint arXiv:2412.01090},
year = {2025}
}