VS3R:基于深度 3D 重建的鲁�棒全幅视频稳定方法
计算机视觉与模式识别
2026-03-09 v1
摘要
视频稳定旨在减轻相机抖动,但面临几何鲁棒性与全幅一致性之间的根本性权衡。虽然 2D 方法因激进裁剪而受限,3D 技术常因脆弱的优化管道在极端运动下失效。为填补这一差距,我们提出 VS3R 框架,融合 feed-forward 3D 重建与生成式视频扩散。我们的管道联合估计相机参数、深度和掩码,以确保全场景可靠性,引入混合稳定渲染模块,通过融合语义线索和几何信息实现动态一致性。最后,双流视频扩散模型通过协同结构引导与语义锚点恢复遮挡区域并纠正伪影。总体而言,VS3R 在多样相机模型下实现高保真、全幅稳定,显著优于最先进的方法在鲁棒性和视觉质量方面的性能。
引用
@article{arxiv.2603.05851,
title = {VS3R: Robust Full-frame Video Stabilization via Deep 3D Reconstruction},
author = {Muhua Zhu and Xinhao Jin and Yu Zhang and Yifei Xue and Tie Ji and Yizhen Lao},
journal= {arXiv preprint arXiv:2603.05851},
year = {2026}
}