Sketch-pix2seq:一种生成多类别草图的模型
计算机视觉与模式识别
2017-09-14 v1
摘要
草图是人类交流思想的重要媒介,反映了人类智能的优越性。关于草图的研究大致可分为识别和生成两类。现有的图像识别模型在草图分类上未能获得令人满意的性能。但在草图生成方面,最近的一项研究提出了一种称为 sketch-rnn 的序列到序列变分自编码器 (VAE) 模型,该模型能够根据人类输入生成草图。当要求学习单一类别的物体(如动物或车辆)时,该模型取得了惊人的结果。然而,当向模型输入多个类别时,其性能有所下降。在此,我们提出了一种名为 sketch-pix2seq 的模型,它能够学习并绘制多类别的草图。我们对 sketch-rnn 模型进行了两项改进:一是用卷积神经网络 (CNN) 编码器替换双向循环神经网络 (BRNN) 编码器;二是从 VAE 的目标函数中移除 Kullback-Leibler 散度。实验结果表明,带有 CNN 编码器的模型在生成人类风格草图方面优于带有 RNN 编码器的模型。潜在空间的可视化表明,移除 KL 散度使编码器学习到的潜在空间后验分布能够反映不同类别的特征。此外,CNN 编码器与移除 KL 散度的组合(即 sketch-pix2seq 模型)在学习和生成多类别草图方面表现更好,并在创造性任务中显示出令人鼓舞的结果。
引用
@article{arxiv.1709.04121,
title = {Sketch-pix2seq: a Model to Generate Sketches of Multiple Categories},
author = {Yajing Chen and Shikui Tu and Yuqi Yi and Lei Xu},
journal= {arXiv preprint arXiv:1709.04121},
year = {2017}
}