中文

基于对称蒸馏网络的文本到图像合成

计算机视觉与模式识别 2018-08-22 v1

摘要

文本到图像合成旨在根据用户给出的文本描述自动生成图像,这是一项极具挑战性的任务。文本到图像合成的主要问题存在于两类鸿沟:异质鸿沟与同质鸿沟。异质鸿沟位于文本描述的高层概念与图像的像素级内容之间,而同质鸿沟存在于合成图像分布与真实图像分布之间。针对这些问题,我们利用通用判别模型(如 VGG19)的优异能力,其可在多个层次上引导新生成模型的训练过程以弥合这两类鸿沟。高层表示能够教导生成模型从文本描述中提取必要的视觉信息,从而弥合异质鸿沟。中层与低层表示则分别引导其学习图像的结构与细节,从而缓解同质鸿沟。因此,我们提出了由作为“教师”的源判别模型与作为“学生”的目标生成模型组成的对称蒸馏网络(Symmetrical Distillation Networks, SDN)。目标生成模型与源判别模型具有对称结构,以便可迁移层次化知识。此外,我们将训练过程分解为采用不同蒸馏范式的两阶段,以提升目标生成模型的性能。在两个广泛使用的数据集上的实验验证了我们所提 SDN 的有效性。

关键词

引用

@article{arxiv.1808.06801,
  title  = {Text-to-image Synthesis via Symmetrical Distillation Networks},
  author = {Mingkuan Yuan and Yuxin Peng},
  journal= {arXiv preprint arXiv:1808.06801},
  year   = {2018}
}

备注

9 pages, accepted as an oral paper of ACM Multimedia 2018