中文

在照片中合成特定环境的人物

计算机视觉与模式识别 2024-09-27 v2

摘要

我们提出了 ESP,一种用于上下文感知全身生成的新方法,能够实现照片级真实感的人物合成与图像修复,且人物所穿服装在语义上与输入照片所描绘的场景相匹配。ESP 以 2D 姿态和从场景照片中提取的上下文线索为条件,将其整合到生成过程中,并通过人体解析掩码(Human Parsing Mask, HPM)对服装进行显式建模。生成的 HPM 被用作图像修复的紧密引导掩码,从而确保不对原始背景做任何改动。我们的模型在一个包含涵盖多种不同环境的真实人物照片的数据集上进行训练。我们对该方法进行了定量和定性分析,结果表明 ESP 在上下文感知全身生成任务上优于现有最优方法。

关键词

引用

@article{arxiv.2312.14579,
  title  = {Synthesizing Environment-Specific People in Photographs},
  author = {Mirela Ostrek and Carol O'Sullivan and Michael J. Black and Justus Thies},
  journal= {arXiv preprint arXiv:2312.14579},
  year   = {2024}
}

备注

Accepted at ECCV 2024, Project: https://esp.is.tue.mpg.de