中文

UMFuse:面向人体编辑应用的统一多视角融合

计算机视觉与模式识别 2023-03-29 v4 人工智能

摘要

由于广泛的实际应用,视觉界已探索了众多姿态引导的人体编辑方法。然而,这些方法大多仍使用图像到图像的框架,其中给定单张图像作为输入以生成编辑后的图像作为输出。当目标姿态与输入姿态差异显著时,该目标变得定义不良。现有方法随后求助于图像补全或风格迁移来处理遮挡并保留内容。在本文中,我们探索利用多视角以最小化信息缺失问题并生成底层人体模型的准确表示。为融合来自多个视点的知识,我们设计了一个多视角融合网络,该网络接收来自多个源图像的姿态关键点和纹理,并生成可解释的逐像素外观检索图。此后,来自单独网络(在单视角人体重摆姿任务上训练)的编码在潜空间中被合并。这使我们能够为不同编辑任务生成准确、精确且视觉连贯的图像。我们展示了我们的网络在两个新提出的任务上的应用——多视角人体重摆姿和混合匹配人体图像生成。此外,我们研究了单视角编辑的局限性以及多视角提供更好替代方案的场景。

关键词

引用

@article{arxiv.2211.10157,
  title  = {UMFuse: Unified Multi View Fusion for Human Editing applications},
  author = {Rishabh Jain and Mayur Hemani and Duygu Ceylan and Krishna Kumar Singh and Jingwan Lu and Mausoom Sarkar and Balaji Krishnamurthy},
  journal= {arXiv preprint arXiv:2211.10157},
  year   = {2023}
}

备注

8 pages, 6 figures