中文

幻觉化姿态兼容场景

计算机视觉与模式识别 2022-10-04 v2

摘要

人体姿态能告诉我们关于场景的什么信息?我们提出一项任务来回答这个问题:以人体姿态为输入,幻觉化一个兼容场景。人体姿态所捕捉的细微线索——动作语义、环境可供性、物体交互——为哪些场景是兼容的提供了令人惊讶的洞察。我们提出一个用于姿态条件场景生成的大规模生成对抗网络(GAN)。我们大幅扩展了训练数据的规模和复杂度,整理了一个包含超过 1900 万帧日常环境中人类的大规模元数据集。我们将模型容量相对于 StyleGAN2 翻倍以处理此类复杂数据,并设计了一种姿态调节机制,驱动模型学习姿态与场景之间的细微关系。我们利用训练好的模型用于多种应用:幻觉化带人或不带人的姿态兼容场景、可视化不兼容的场景与姿态、将一人从生成图像放入另一场景、以及姿态动画。我们的模型生成多样样本,并在准确人体放置(正确关键点百分比)和质量(Frechet inception distance)方面优于姿态条件的 StyleGAN2 和 Pix2Pix/Pix2PixHD 基线。

关键词

引用

@article{arxiv.2112.06909,
  title  = {Hallucinating Pose-Compatible Scenes},
  author = {Tim Brooks and Alexei A. Efros},
  journal= {arXiv preprint arXiv:2112.06909},
  year   = {2022}
}