IconShop:基于自回归 Transformer 的文本引导矢量图标合成
计算机视觉与模式识别
2023-06-08 v4 图形学
摘要
可缩放矢量图形(SVG)是一种流行的矢量图像格式,对交互性和动画提供了良好支持。尽管具有吸引人的特性,但由于理解 SVG 语法或熟悉专业编辑软件所需的学习曲线陡峭,用户创建自定义 SVG 内容可能具有挑战性。近期文本到图像生成的进展启发了研究者探索使用基于图像的方法(即文本 -> 栅格图像 -> 矢量图形,结合文本到图像生成模型与图像矢量化)或基于语言的方法(即文本 -> 矢量图形脚本,通过预训练大语言模型)进行矢量图形合成。然而,这些方法在生成质量、多样性和灵活性方面仍存在局限。本文中,我们介绍了 IconShop,一种使用自回归 Transformer 的文本引导矢量图标合成方法。我们方法成功的关键是将 SVG 路径(以及作为引导的文本描述)序列化并标记为唯一可解码的令牌序列。借此,我们能够充分利用自回归 Transformer 的序列学习能力,同时支持无条件与文本条件的图标合成。通过在带有文本描述的大规模矢量图标数据集上预测下一令牌的标准训练,所提出的 IconShop 在定量和定性上均持续展现出优于现有基于图像和基于语言方法的图标合成能力。同时,我们观察到生成多样性上的显著提升,这由客观的 Unique 和 Novelty 度量验证。更重要的是,我们展示了 IconShop 在多项新颖图标合成任务上的灵活性,包括图标编辑、图标插值、图标语义组合和图标设计自动建议。
引用
@article{arxiv.2304.14400,
title = {IconShop: Text-Guided Vector Icon Synthesis with Autoregressive Transformers},
author = {Ronghuan Wu and Wanchao Su and Kede Ma and Jing Liao},
journal= {arXiv preprint arXiv:2304.14400},
year = {2023}
}
备注
Project Page: https://icon-shop.github.io/