从单张图像实时生成人类正面视图
计算机视觉与模式识别
2026-03-17 v1
摘要
从单张图像实现逼真的人类新视角合成对于 democratizing 沉浸式 3D 远程办公至关重要,无需复杂的多摄像机 setup。然而,当前以渲染为中心的方法侧重视觉保真度,缺乏对几何的显式理解,难以处理面部和手部等细节区域,导致时序不稳定。人类中心框架则因依赖外部模型提供结构性先验而出现内存瓶颈,限制了实时性能。为此,我们提出 PrismMirror,一个几何引导的框架,用于从单张图像实现即时正面视图合成。通过避免外部几何建模并聚焦于正面视图合成,模型优化了远程办公的视觉完整性。具体而言,PrismMirror 引入一种新颖的级联学习策略,实现粗到细的几何特征学习:首先直接学习粗糙的几何特征(如 SMPL-X 网格和点云),再通过渲染监督细化纹理。为实现实时效率,我们将该统一框架蒸馏为轻量级线性注意力模型。值得注意的是,PrismMirror 是首个实现 24 FPS 实时推理的单目人类正面视图合成模型,在视觉真实性和结构精确性方面均显著优于先前方法。
关键词
引用
@article{arxiv.2603.15433,
title = {Real-Time Human Frontal View Synthesis from a Single Image},
author = {Fangyu Lin and Yingdong Hu and Lunjie Zhu and Zhening Liu and Yushi Huang and Zehong Lin and Jun Zhang},
journal= {arXiv preprint arXiv:2603.15433},
year = {2026}
}