通过点轨迹处理基于普通视频的快速编码器三维重建
计算机视觉与模式识别
2024-06-28 v2
摘要
本文探讨了从包含动态内容的视频中重建三维结构这一长期挑战。现有的方法并非为处理标准相机拍摄的普通视频而设计,或者需要很长的优化时间。为了显著提升先前方法的效率,我们提出了 TracksTo4D,这是一种基于学习的方法,能够通过单次高效的前馈推理,从普通视频的动态内容中推断出三维结构和相机位置。为实现这一目标,我们建议直接以二维点轨迹作为输入进行操作,并设计了一种专为处理二维点轨迹量身定制的架构。我们提出的架构设计遵循两个关键原则:(1)考虑了输入点轨迹数据中固有的对称性;(2)假设运动模式可以使用低秩近似来有效表示。TracksTo4D 在普通视频数据集上以无监督方式进行训练,仅利用从视频中提取的二维点轨迹,无需任何三维监督。我们的实验表明,TracksTo4D 能够重建底层视频的时间点云和相机位置,准确率与 SOTA 方法相当,同时将运行时间大幅缩减了高达 95%。我们进一步表明,TracksTo4D 在推理时能很好地泛化到未见语义类别的未见视频上。
引用
@article{arxiv.2404.07097,
title = {Fast Encoder-Based 3D from Casual Videos via Point Track Processing},
author = {Yoni Kasten and Wuyue Lu and Haggai Maron},
journal= {arXiv preprint arXiv:2404.07097},
year = {2024}
}