测试时利用先验条件的3D重建学习
计算机视觉与模式识别
2026-04-07 v1
摘要
我们提出了一种针对多视图Transformer(MVT)的测试时框架,融合先验条件(如相机姿态、内参和深度)以无需重新训练或修改预训练的仅图像网络来提高3D任务性能。我们不将先验条件输入网络架构,而是将其作为预测的约束条件进行优化。优化损失由自监督目标和先验惩罚项组成。自监督目标捕获多视图预测之间的兼容性,通过其他视图的渲染与当前视图之间的光度或几何损失实现。任何可用的先验条件均转换为相应输出模态的惩罚项。在一系列3D视觉基准测试中,包括点图估计和相机姿态估计,我们的方法在不使用先验条件的基础MVT上显著优于后者。 在 ETH3D、7-Scenes 和 NRGBD 数据集上,我们的方法将点图距离误差缩短一半以上。我们的方法也超越了重新训练的先验感知式前馈方法,证明了我们的测试时受限优化(TCO)框架在3D视觉任务中整合先验条件的有效性。
关键词
引用
@article{arxiv.2604.03878,
title = {Learning 3D Reconstruction with Priors in Test Time},
author = {Lei Zhou and Haoyu Wu and Akshat Dave and Dimitris Samaras},
journal= {arXiv preprint arXiv:2604.03878},
year = {2026}
}
备注
Accepted to CVPR2026. Code link: https://github.com/cvlab-stonybrook/TCO