基于单目视频的新视角与新姿态人体神经渲染
计算机视觉与模式识别
2023-04-21 v2
摘要
我们提出一种新方法,以单目视频为输入,生成新视角与新姿态下的照片级真实感人体。尽管近期该主题取得显著进展,若干方法探索动态场景中的共享规范神经辐射场,学习一个面向未知姿态的用户可控模型仍具挑战。为应对此问题,我们引入一种有效方法以 a)跨多帧整合观测并 b)编码每帧外观。我们通过将建模人体形状的人体姿态以及部分覆盖人体的点云作为输入来实现这一点。我们的方法同时学习多帧间锚定于人体姿态的一组共享潜在编码,以及锚定于由每帧及其预测深度生成的不完整点云的外观相关编码。前者基于人体姿态的编码建模表演者形状,而后者基于点云的编码预测细粒度细节并推断未知姿态下的缺失结构。为进一步恢复查询帧中不可见区域,我们采用时间 transformer 整合查询帧点特征与自动选定关键帧的跟踪人体点。在包括 ZJU-MoCap 的不同数据集动态人体序列上的实验表明,给定单目视频输入,我们的方法在未知姿态与新视角下显著优于现有方法。
引用
@article{arxiv.2204.01218,
title = {Neural Rendering of Humans in Novel View and Pose from Monocular Video},
author = {Tiantian Wang and Nikolaos Sarafianos and Ming-Hsuan Yang and Tony Tung},
journal= {arXiv preprint arXiv:2204.01218},
year = {2023}
}
备注
10 pages