中文

MaskGAN:面向多样化与可交互的人脸图像编辑

计算机视觉与模式识别 2020-04-02 v2 图形学 机器学习

摘要

近年来,人脸图像编辑取得了巨大进展。然而,以往的方法要么在预定义的一组人脸属性上操作,要么留给用户极少自由以交互式地编辑图像。为克服这些缺陷,我们提出了一种称为 MaskGAN 的新框架,支持多样化且可交互的人脸编辑。我们的核心见解是,语义掩码作为一种合适的中间表示,可在保持保真度的同时实现灵活的人脸编辑。MaskGAN 包含两个主要组件:1) 稠密映射网络(Dense Mapping Network, DMN)和 2) 编辑行为模拟训练(Editing Behavior Simulated Training, EBST)。具体而言,DMN 学习自由形式用户修改掩码与目标图像之间的风格映射,从而实现多样化的生成结果。EBST 对用户在源掩码上的编辑行为进行建模,使整体框架对各种被编辑的输入更加鲁棒。具体而言,它引入双重编辑一致性作为辅助监督信号。为促进广泛研究,我们构建了一个名为 CelebAMask-HQ 的、带有细粒度掩码标注的大规模高分辨率人脸数据集。MaskGAN 在两个具有挑战性的任务上进行了全面评估:属性迁移与风格拷贝,展现出优于其他 SOTA 方法的性能。代码、模型与数据集可在 https://github.com/switchablenorms/CelebAMask-HQ 获取。

关键词

引用

@article{arxiv.1907.11922,
  title  = {MaskGAN: Towards Diverse and Interactive Facial Image Manipulation},
  author = {Cheng-Han Lee and Ziwei Liu and Lingyun Wu and Ping Luo},
  journal= {arXiv preprint arXiv:1907.11922},
  year   = {2020}
}

备注

To appear in IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2020. The code, models and dataset are available at: https://github.com/switchablenorms/CelebAMask-HQ