中文

CLIPDraw++:基于简单图元的文本到草图合成

计算机视觉与模式识别 2025-07-10 v2

摘要

为了理解 CLIP 与文本提示相关联的视觉概念,我们证明 CLIP 的潜空间可以仅通过直线、圆等简单几何图元上的线性变换来可视化。尽管现有方法通过"基于优化的草图合成"实现了这一点,但它们是在高阶 Bézier 曲线的空间中进行的,这些曲线可以演化出的结构集合过于庞大且浪费,因为其中大多数对于生成有意义的草图而言并非必需。我们提出了 CLIPDraw++,一种仅使用直线、圆等简单基本形状即可为 CLIP 文本嵌入提供显著更优可视化的算法。这将可能的输出集合约束为这些图元上的线性变换,从而呈现出本质上更简洁的数学形式。CLIPDraw++ 的合成过程可端到端跟踪,每个视觉概念都仅以图元形式表达。项目页面:https://clipdrawx.github.io/。

关键词

引用

@article{arxiv.2312.02345,
  title  = {CLIPDraw++: Text-to-Sketch Synthesis with Simple Primitives},
  author = {Nityanand Mathur and Shyam Marjit and Abhra Chaudhuri and Anjan Dutta},
  journal= {arXiv preprint arXiv:2312.02345},
  year   = {2025}
}

备注

Accepted at CVPRW-25. Project Page: https://clipdrawx.github.io/