Any4D:统一的前馈式度量尺 4D 重建
计算机视觉与模式识别
2025-12-12 v1 人工智能
机器学习
机器人学
摘要
我们提出了 Any4D,一个可扩展的多视图变换器,用于度量尺、稠密的前馈式 4D 重建。Any4D 直接生成 N 个帧的每个像素的运动和几何预测,与先前工作通常仅聚焦于 2 视图稠密场景流或稀疏 3D 点跟踪的不同。此外,与其他最近用于从单目 RGB 视频进行 4D 重建的方法不同,Any4D 可以处理额外的模态和传感器数据,例如 RGB-D 帧、基于 IMU 的自身运动和雷达 Doppler 测量。使其能够实现如此灵活的框架的一个关键创新是 4D 场景的模块化表示;具体而言,per-view 4D 预测使用各种以局部相机坐标表示的本征因子(深度图和相机内参)编码,而以全局世界坐标表示的异构因子(相机外参和场景流)编码。我们在多种设置下实现了卓越的性能——在精度(误差降低 2-3 倍)和计算效率(加快 15 倍)方面均优于现有方法,为多个下游应用开辟了可能性。
引用
@article{arxiv.2512.10935,
title = {Any4D: Unified Feed-Forward Metric 4D Reconstruction},
author = {Jay Karhade and Nikhil Keetha and Yuchen Zhang and Tanisha Gupta and Akash Sharma and Sebastian Scherer and Deva Ramanan},
journal= {arXiv preprint arXiv:2512.10935},
year = {2025}
}
备注
Project Website: https://any-4d.github.io/