中文

StrokeNUWA:为矢量图形合成标记笔画

计算机视觉与模式识别 2024-01-31 v1 计算与语言

摘要

为了利用大语言模型 (LLM) 进行视觉合成,传统方法通过专门的视觉模块将光栅图像信息转换为离散的网格标记,但这破坏了模型捕捉视觉场景真实语义表示的能力。本文提出,图像的另一种表示形式——矢量图形,可以通过实现更自然且语义连贯的图像信息分割,有效地克服这一限制。因此,我们引入了 StrokeNUWA,这是一项探索矢量图形上更好的视觉表示“笔画标记”的开创性工作,这种表示具有内在的丰富视觉语义、与大语言模型 (LLM) 自然兼容且高度压缩。配备了笔画标记,StrokeNUWA 在矢量图形生成任务中的各项指标上,能够显著超越传统的基于大语言模型和基于优化的方法。此外,StrokeNUWA 的推理速度比先前方法快达 94 倍,并实现了 6.9% 的卓越 SVG 代码压缩率。

关键词

引用

@article{arxiv.2401.17093,
  title  = {StrokeNUWA: Tokenizing Strokes for Vector Graphic Synthesis},
  author = {Zecheng Tang and Chenfei Wu and Zekai Zhang and Mingheng Ni and Shengming Yin and Yu Liu and Zhengyuan Yang and Lijuan Wang and Zicheng Liu and Juntao Li and Nan Duan},
  journal= {arXiv preprint arXiv:2401.17093},
  year   = {2024}
}