中文

用于密集预测的空间提升方法

计算机视觉与模式识别 2025-07-15 v1 机器学习 图像与视频处理

摘要

我们提出空间提升(Spatial Lifting, SL),一种用于密集预测任务的新方法。SL通过将标准输入(例如2D图像)提升到更高维空间,然后使用为该更高维度设计的网络(例如3D U-Net)进行处理。与直觉相反,这种维度提升使我们能够在基准任务上获得与传统方法相当的性能,同时降低推理成本并显著减少模型参数数量。SL框架沿着提升的维度产生内在结构化的输出。这种涌现的结构便于在训练期间进行密集监督,并在测试时实现鲁棒的、近乎零额外成本的预测质量评估。我们在19个基准数据集(13个用于语义分割,6个用于深度估计)上验证了我们的方法,展示了具有竞争力的密集预测性能,同时将模型参数数量减少了超过98%(在U-Net情况下)并降低了推理成本。空间提升引入了一种新的视觉建模范式,为视觉中密集预测任务提供了一条通往更高效、更准确、更可靠的深度网络的有前景的路径。

关键词

引用

@article{arxiv.2507.10222,
  title  = {Spatial Lifting for Dense Prediction},
  author = {Mingzhi Xu and Yizhe Zhang},
  journal= {arXiv preprint arXiv:2507.10222},
  year   = {2025}
}

备注

Preprint. Under review