MT-Depth:用于深度补全的多任务实例特征分析
计算机视觉与模式识别
2026-05-29 v3 人工智能
摘要
深度补全在 3D 感知系统中起着至关重要的作用,特别是在需要将稀疏深度数据稠化以用于自主驾驶、机器人和增强现实等任务的场景中。虽然许多现有方法依赖语义分割来引导深度补全,但它们往往忽略了对象级理解的好处。在这项工作中,我们引入了一种实例感知的深度补全框架,明确地将二值实例掩码作为空间先验来细化深度预测。我们的模型结合了四个主要组件:一个冻结的 YOLO V11 实例分割分支、一个基于 U-Net 的深度补全主干、一个交叉注意力融合模块和一个注意力引导预测头。实例分割分支生成每图像的前景掩码,通过交叉注意力引导深度分支,使网络能够在细化过程中聚焦于以对象为中心的区域。我们在 Virtual KITTI 2 数据集上验证了我们的方法,结果表明,与仅使用 U-Net 的基线和先前的语义引导方法相比,该方法实现了更低的均方根误差(RMSE),同时保持了具有竞争力的平均绝对误差(MAE)。定性和定量结果表明,所提出的模型有效提升了对象边界、遮挡和薄结构附近的深度精度。我们的发现表明,引入实例感知线索为在不依赖密集语义标签的情况下提升深度补全提供了一个有前景的方向。
引用
@article{arxiv.2512.04733,
title = {E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving},
author = {Yihong Tang and Haicheng Liao and Tong Nie and Junlin He and Ao Qu and Kehua Chen and Wei Ma and Zhenning Li and Lijun Sun and Chengzhong Xu},
journal= {arXiv preprint arXiv:2512.04733},
year = {2026}
}