中文

Pippo:从单张图像生成高分辨率多视角人体

计算机视觉与模式识别 2025-02-12 v1 图形学

摘要

我们提出了 Pippo,一种生成模型,能够从单张随手拍摄的照片生成 1K 分辨率的密集环绕视频。Pippo 是一个多视角扩散 Transformer,不需要任何额外输入——例如,拟合的参数化模型或输入图像的相机参数。我们在 30 亿张无标注的人体图像上预训练 Pippo,并对工作室捕获的人体进行多视角中训练和后训练。在中训练期间,为了快速吸收工作室数据集,我们以低分辨率对多个(最多 48 个)视角进行去噪,并使用浅层 MLP 粗略编码目标相机。在后训练期间,我们以高分辨率对较少视角进行去噪,并使用像素对齐的控制(例如,空间锚点和 Plucker 射线)来实现 3D 一致性生成。在推理时,我们提出了一种注意力偏置技术,允许 Pippo 同时生成比训练期间多 5 倍以上的视角。最后,我们还引入了一种改进的指标来评估多视角生成的 3D 一致性,并表明 Pippo 在从单张图像生成多视角人体方面优于现有工作。

关键词

引用

@article{arxiv.2502.07785,
  title  = {Pippo: High-Resolution Multi-View Humans from a Single Image},
  author = {Yash Kant and Ethan Weber and Jin Kyu Kim and Rawal Khirodkar and Su Zhaoen and Julieta Martinez and Igor Gilitschenski and Shunsuke Saito and Timur Bagautdinov},
  journal= {arXiv preprint arXiv:2502.07785},
  year   = {2025}
}

备注

Project Page - http://yashkant.github.io/pippo