中文

U-Sketch:一种高效的草图到图像扩散模型方法

计算机视觉与模式识别 2026-03-30 v1 人工智能 机器学习

摘要

扩散模型在文本到图像合成中展现出了卓越的性能,能够生成逼真且高分辨率的图像,并忠实地遵循相应的文本提示。尽管取得了巨大成功,它们在草图到图像合成任务中仍然落后,在此任务中,除了文本提示外,生成图像的空间布局还必须紧密遵循特定参考草图的轮廓。近期有人提出利用 MLP 潜在边缘预测器,通过在每个去噪步骤预测边缘图来引导合成图像的空间布局。尽管取得了有希望的结果,但 MLP 的逐像素操作未将空间布局视为一个整体,并且需要大量的去噪迭代才能生成令人满意的图像,导致时间效率低下。为此,我们引入了 U-Sketch,这是一个具有 U-Net 类型潜在边缘预测器的框架,它能够高效地捕获局部和全局特征以及像素之间的空间相关性。此外,我们提出加入一个草图简化网络,为用户提供预处理和简化输入草图的选择,以增强输出效果。实验结果辅以用户反馈表明,我们提出的 U-Net 潜在边缘预测器能产生更逼真的结果,且与参考草图的空间轮廓对齐更好,同时大幅减少了所需的去噪步骤数,从而减少了整体执行时间。

关键词

引用

@article{arxiv.2403.18425,
  title  = {U-Sketch: An Efficient Approach for Sketch to Image Diffusion Models},
  author = {Ilias Mitsouras and Eleftherios Tsonis and Paraskevi Tzouveli and Athanasios Voulodimos},
  journal= {arXiv preprint arXiv:2403.18425},
  year   = {2026}
}