基于神经路径表示的文本到向量生成
计算机视觉与模式识别
2024-05-21 v2 图形学
摘要
向量图在数字艺术中广泛应用,因其可缩放性和分层特性而备受设计师青睐。然而,创建和编辑向量图需要创造力和设计专业知识,这使得该过程耗时。最近的文本到向量(Text-to-Vector, T2V)生成技术旨在使其更易于访问。然而,现有的T2V方法直接优化向量图路径的控制点,常导致路径相交或锯齿状,由于缺乏几何约束。为克服这些限制,我们提出了一种新颖的神经路径表示,通过设计双分支变分自编码器(Variational Autoencoder, VAE)从序列和图像模态中学习路径潜在空间。通过优化神经路径的组合,我们可以在保持生成SVG表达力的同时纳入几何约束。此外,我们引入了两阶段路径优化方法,以提高生成SVG的视觉和拓扑质量。在第一阶段,预训练的文本到图像扩散模型通过变分得分蒸馏(Variational Score Distillation, VSD)过程引导复杂向量图的初始生成。在第二阶段,我们采用基于图层的图像矢量化策略对图形进行细化,以实现更清晰的元素和结构。我们通过大量实验展示了方法的有效性,并展示了 various applications。项目页面为 https://intchous.github.io/T2V-NPR。
引用
@article{arxiv.2405.10317,
title = {Text-to-Vector Generation with Neural Path Representation},
author = {Peiying Zhang and Nanxuan Zhao and Jing Liao},
journal= {arXiv preprint arXiv:2405.10317},
year = {2024}
}
备注
Accepted by SIGGRAPH 2024. Project page: https://intchous.github.io/T2V-NPR