单目视频动态场景的前馈子弹时间重建
计算机视觉与模式识别
2025-09-23 v3 人工智能
图形学
摘要
静态场景前馈重建的最新进展已在新型视图合成方面取得了显著进步。然而,这些模型通常难以泛化到不同环境,并且无法有效处理动态内容。我们提出了BTimer,首个用于动态场景实时重建和新型视图合成的运动感知前馈模型。我们的方法通过聚合所有上下文帧的信息,在目标“子弹时间”时刻以3D高斯表示重建整个场景。这种设计使BTimer能够利用静态和动态场景数据集,从而获得可扩展性和泛化能力。给定一个随意的单目动态视频,BTimer可在150毫秒内重建子弹时间场景,并在静态和动态场景数据集上均达到最先进的性能,甚至可与基于优化的方法相媲美。
关键词
引用
@article{arxiv.2412.03526,
title = {Feed-Forward Bullet-Time Reconstruction of Dynamic Scenes from Monocular Videos},
author = {Hanxue Liang and Jiawei Ren and Ashkan Mirzaei and Antonio Torralba and Ziwei Liu and Igor Gilitschenski and Sanja Fidler and Cengiz Oztireli and Huan Ling and Zan Gojcic and Jiahui Huang},
journal= {arXiv preprint arXiv:2412.03526},
year = {2025}
}
备注
Project website: https://research.nvidia.com/labs/toronto-ai/bullet-timer/