基于单视角输入的实时位置感知视图合成
计算机视觉与模式识别
2025-10-14 v2 图形学
多媒体
摘要
视图合成领域的最新进展显著增强了各种计算机图形学和多媒体应用(包括远程呈现和娱乐)中的沉浸式体验。通过从单一输入视图生成新视角,视图合成使用户能够更好地感知和交互其环境。然而,许多最先进的方法虽然实现了高视觉质量,但在实时性能方面存在局限,这使得它们不太适用于对低延迟至关重要的实时应用。在本文中,我们提出了一种轻量级的位置感知网络,用于从单张输入图像和目标相机姿态进行实时视图合成。所提出的框架包括一个位置感知嵌入模块,该模块高效地映射目标姿态的位置信息以生成高维特征图。这些特征图与输入图像一起被送入渲染网络,该网络融合来自双编码器分支的特征以解析高、低层次细节,从而生成场景的真实新视图。实验结果表明,与现有方法相比,我们的方法在处理复杂平移运动时无需显式几何操作(如扭曲)即可实现卓越的效率和视觉质量。这项工作朝着实现实时、交互式远程呈现应用迈出了一步。
引用
@article{arxiv.2412.14005,
title = {Real-Time Position-Aware View Synthesis from Single-View Input},
author = {Manu Gond and Emin Zerman and Sebastian Knorr and Mårten Sjöström},
journal= {arXiv preprint arXiv:2412.14005},
year = {2025}
}