中文

基于神经路径表示的文本到向量生成

计算机视觉与模式识别 2024-05-21 v2 图形学

摘要

向量图在数字艺术中广泛应用,因其可缩放性和分层特性而备受设计师青睐。然而,创建和编辑向量图需要创造力和设计专业知识,这使得该过程耗时。最近的文本到向量(Text-to-Vector, T2V)生成技术旨在使其更易于访问。然而,现有的T2V方法直接优化向量图路径的控制点,常导致路径相交或锯齿状,由于缺乏几何约束。为克服这些限制,我们提出了一种新颖的神经路径表示,通过设计双分支变分自编码器(Variational Autoencoder, VAE)从序列和图像模态中学习路径潜在空间。通过优化神经路径的组合,我们可以在保持生成SVG表达力的同时纳入几何约束。此外,我们引入了两阶段路径优化方法,以提高生成SVG的视觉和拓扑质量。在第一阶段,预训练的文本到图像扩散模型通过变分得分蒸馏(Variational Score Distillation, VSD)过程引导复杂向量图的初始生成。在第二阶段,我们采用基于图层的图像矢量化策略对图形进行细化,以实现更清晰的元素和结构。我们通过大量实验展示了方法的有效性,并展示了 various applications。项目页面为 https://intchous.github.io/T2V-NPR。

关键词

引用

@article{arxiv.2405.10317,
  title  = {Text-to-Vector Generation with Neural Path Representation},
  author = {Peiying Zhang and Nanxuan Zhao and Jing Liao},
  journal= {arXiv preprint arXiv:2405.10317},
  year   = {2024}
}

备注

Accepted by SIGGRAPH 2024. Project page: https://intchous.github.io/T2V-NPR