3DTV:用于实时视图合成的前馈插值网络
计算机视觉与模式识别
2026-04-14 v1 机器学习
多媒体
摘要
实时自由视点渲染需要在多摄像机冗余性与交互式应用的延迟约束之间进行权衡。我们通过结合轻量几何与学习方法,提出 3DTV,一个用于实时稀疏视图插值的前馈网络。Delaunay 基于三角形选择确保每个目标视角的角度覆盖。基于此,我们引入一种姿态感知深度模块,用于估计粗到细深度金字塔,从而实现高效特征重投影和遮挡感知混合。不同于需要场景特定优化的方法,3DTV 在没有重新训练的情况下运行前馈,适用于 AR/VR、远距离传感和交互式应用。我们的在具有挑战性的多视图视频数据集上的实验表明,3DTV 在质量与效率之间始终实现强大的平衡,优于最近的实时新视角基线方法。关键的是,3DTV 避免了显式代理,使其在 diverse 场景中实现稳健渲染。这使得其成为低延迟多视图流和交互式渲染的实用解决方案。项目页面:https://stefanmschulz.github.io/3DTV_webpage/
引用
@article{arxiv.2604.11211,
title = {3DTV: A Feedforward Interpolation Network for Real-Time View Synthesis},
author = {Stefan Schulz and Fernando Edelstein and Hannah Dröge and Matthias B. Hullin and Markus Plack},
journal= {arXiv preprint arXiv:2604.11211},
year = {2026}
}