DePT3R:单前向传递中动态场景的联合稠密点跟踪与3D重建
计算机视觉与模式识别
2026-04-06 v2 人工智能
摘要
当前用于动态场景中稠密3D点跟踪的方法通常依赖成对处理,要求已知相机姿态,或假设输入帧的时序关系,从而限制了其灵活性和适用性。此外,近期的进展成功地实现了从大规模无姿态图像集合中进行高效3D重建,凸显了统一方法进行动态场景理解的潜力。为此,我们提出DePT3R,一种新型框架,能够在单次前向传递中同时执行动态场景的稠密点跟踪和3D重建。通过提取强大的背部网络的深层时空特征,并使用稠密预测头回归像素级图实现了多任务学习。关键在于,DePT3R无需相机姿态,大大增强了其适应性和效率,尤其在动态环境中变化快速的情况下更为重要。我们在多个具有挑战性的动态场景基准上验证了DePT3R,展示了强大的性能和在内存效率方面相较于现有最先进方法的显著提升。数据和代码已通过开放仓库提供:https://github.com/StructuresComp/DePT3R
引用
@article{arxiv.2512.13122,
title = {DePT3R: Joint Dense Point Tracking and 3D Reconstruction of Dynamic Scenes in a Single Forward Pass},
author = {Vivek Alumootil and Tuan-Anh Vu},
journal= {arXiv preprint arXiv:2512.13122},
year = {2026}
}
备注
This is a work in progress