中文

ComicGAN:文本到漫画的生成对抗网络

计算机视觉与模式识别 2021-09-21 v1 机器学习

摘要

绘制并标注漫画插图是一个复杂而困难的过程。现有机器学习算法均尚未被开发用于基于插图描述或漫画对话来创作漫画插图。此外,尚不清楚生成对抗网络(GAN)能否生成与对话和/或描述相对应的原创漫画。GAN 在生成照片级真实图像方面取得成功,但该技术未必能转化为无瑕疵漫画的生成。而且,漫画评价是一显著挑战,因为常用指标如 Inception Score 表现不可比,因其设计用于照片。本文中:1. 我们实现了 ComicGAN,一种基于文本到图像 GAN 的新型文本到漫画流水线,其根据文本描述合成漫画。2. 我们描述了对使用 GAN 进行漫画生成技术难点的深入实证研究。ComicGAN 有两个新颖特征:(i)通过排列与增广从标签创建文本描述,以及(ii)用卷积神经网络进行自定义图像编码。我们在两种场景下广泛评估所提 ComicGAN,即根据描述生成图像和根据对话生成图像。我们在 1000 个 Dilbert 漫画面板和 6000 条描述上的结果显示,来自文本输入的合成漫画面板类似于原始 Dilbert 面板。新颖的文本描述创建与自定义图像编码方法相较基线算法在 Frechet Inception Distance、细节和整体图像质量上带来改进。从描述生成插图给出了清晰的漫画,包括描述中指定的角色与颜色。

关键词

引用

@article{arxiv.2109.09120,
  title  = {ComicGAN: Text-to-Comic Generative Adversarial Network},
  author = {Ben Proven-Bessel and Zilong Zhao and Lydia Chen},
  journal= {arXiv preprint arXiv:2109.09120},
  year   = {2021}
}