中文

StyleCLIPDraw:文本到绘图翻译中内容与风格的耦合

计算机视觉与模式识别 2022-02-28 v1

摘要

利用机器学习生成符合给定文本描述的图像,随着 CLIP 图像-文本编码器模型等技术的发布已取得巨大进步;然而,当前方法缺乏对生成图像风格的艺术控制。我们提出一种针对给定文本描述生成风格化绘图的方法,用户可使用样本图像指定期望的绘图风格。受艺术中风格与内容在创作过程中通常不可分离这一理论的启发,我们提出一种称为 StyleCLIPDraw 的耦合方法,即通过在整个过程中同时优化风格与内容来生成绘图,而非在顺序创建内容后施加风格迁移。基于人工评估,StyleCLIPDraw 生成图像的风格相较顺序方法更受强烈偏好。尽管某些风格下内容生成质量下降,但综合考量内容与风格,StyleCLIPDraw 被发现远更受偏好,这表明机器生成图像的风格、外观与质感对人而言十分重要,也表明风格在绘图过程本身中是耦合的。我们的代码(https://github.com/pschaldenbrand/StyleCLIPDraw)、演示(https://replicate.com/pschaldenbrand/style-clip-draw)和风格评估数据(https://www.kaggle.com/pittsburghskeet/drawings-with-style-evaluation-styleclipdraw)均已公开。

关键词

引用

@article{arxiv.2202.12362,
  title  = {StyleCLIPDraw: Coupling Content and Style in Text-to-Drawing Translation},
  author = {Peter Schaldenbrand and Zhixuan Liu and Jean Oh},
  journal= {arXiv preprint arXiv:2202.12362},
  year   = {2022}
}