Vector Grimoire: 基于码本的栅格图像监督形状生成
计算机视觉与模式识别
2024-10-10 v1 人工智能
图形学
摘要
可缩放矢量图形(SVG)是网络和设计行业中流行的格式。然而,尽管生成式建模取得了巨大进步,但由于SVG数据的离散和复杂性质,该领域仍未得到充分探索。我们引入了GRIMOIRE,一个文本引导的SVG生成模型,由两个模块组成:视觉形状量化器(VSQ)学习通过将栅格图像重建为矢量形状来将其映射到离散码本;自回归Transformer(ART)对形状标记、位置和文本描述的联合概率分布进行建模,使我们能够从自然语言生成矢量图形。与需要SVG数据直接监督的现有模型不同,GRIMOIRE仅使用栅格图像监督来学习形状图像块,这为矢量生成建模开辟了显著更多的数据。我们通过在MNIST数据集上拟合封闭填充形状以及在图标和字体数据上拟合轮廓笔画来展示我们方法的有效性,在生成质量上超越了之前的图像监督方法,在灵活性上超越了矢量监督方法。
引用
@article{arxiv.2410.05991,
title = {Vector Grimoire: Codebook-based Shape Generation under Raster Image Supervision},
author = {Moritz Feuerpfeil and Marco Cipriano and Gerard de Melo},
journal= {arXiv preprint arXiv:2410.05991},
year = {2024}
}