多风格文本到草图生成
计算机视觉与模式识别
2025-11-07 v1
摘要
视觉语言模型的最新进展促进了草图生成领域的进步。然而,现有的专门方法主要侧重于通用合成,缺乏对草图风格进行精确控制的机制。在本工作中,我们提出了一种基于扩散模型的无训练框架,该框架通过文本提示和参考风格草图实现显式的风格指导。与以往覆盖自注意力中键和值矩阵的风格迁移方法不同,我们将参考特征作为辅助信息并结合线性平滑进行整合,同时利用风格-内容指导机制。这种设计有效减少了参考草图的内容泄露,并提高了合成质量,特别是在参考草图与目标草图之间结构相似度较低的情况下。此外,我们扩展了我们的框架,通过整合来自多个参考草图的特征并经由联合 AdaIN 模块进行协调,以支持可控的多风格生成。大量实验表明,我们的方法实现了高质量的草图生成,具有准确的风格对齐和改进的风格控制灵活性。M3S 的官方实现可在 https://github.com/CMACH508/M3S 获取。
引用
@article{arxiv.2511.04123,
title = {Text to Sketch Generation with Multi-Styles},
author = {Tengjie Li and Shikui Tu and Lei Xu},
journal= {arXiv preprint arXiv:2511.04123},
year = {2025}
}
备注
Accepted by NeurIPS 2025