生成工匠:一种语义感知且可控的 CLIPstyler
计算机视觉与模式识别
2022-07-26 v1 人工智能
摘要
须知当前多数图像风格迁移方法要求用户提供特定风格的图片,随后提取该风格特征与纹理以生成图像风格,但仍存在一些问题:用户可能并无参考风格图像,或难以仅凭一张图像概括心中所需风格。近期提出的 CLIPstyler 已解决此问题,其仅基于所提供的风格图像描述即可执行风格迁移。尽管 CLIPstyler 在仅出现风景或人像时表现良好,但在人物与风景共存时会模糊人物并丢失原始语义。基于这些问题,我们展示了一种新颖框架,其使用预训练的 CLIP 文本-图像嵌入模型,并通过 FCN 语义分割网络引导图像风格迁移。具体而言,我们解决了自拍及含人物真实世界风景照的人像过度风格化问题,增强了人像与风景中风格迁移效果的对比,并使不同语义部分的图像风格迁移程度完全可控。我们的 Generative Artisan 解决了 CLIPstyler 的失效情形,并给出定性与定量方法证明我们在自拍及含人物真实世界风景照上均远优于 CLIPstyler。该改进使我们的框架有望应用于修图图形软件等商业场景。
引用
@article{arxiv.2207.11598,
title = {Generative Artisan: A Semantic-Aware and Controllable CLIPstyler},
author = {Zhenling Yang and Huacheng Song and Qiunan Wu},
journal= {arXiv preprint arXiv:2207.11598},
year = {2022}
}