中文

StableSketcher:通过视觉问答反馈增强用于像素级草图生成的扩散模型

计算机视觉与模式识别 2026-04-15 v2 人工智能

摘要

尽管最近的扩散模型研究在显著提升生成图像质量方面取得了显著进展,但在合成基于像素的人工绘制草图方面仍面临挑战,这是一种典型的抽象表现形式。为应对这些挑战,我们提出了StableSketcher——一个能够使扩散模型生成高保真度提示草图的新型框架。在该框架内部,我们对变分自编码器进行微调,以优化潜在解码,以更好地捕获草图的特征。同时,我们集成了一种基于视觉问答的新型强化学习奖励函数,以提高文本-图像对齐和语义一致性。大量实验表明,StableSketcher生成的草图在风格保真度方面得到改善,与提示词的对齐效果优于Stable Diffusion基线。此外,我们引入了SketchDUO数据集,我们在已知情况下是首个包含实例级草图及其对应的描述和问答对的数据集,从而弥补了现有数据集仅依赖图像-标签配对的局限性。我们的代码和数据集将在接受录用后公开。项目页面:https://zihos.github.io/StableSketcher

关键词

引用

@article{arxiv.2510.20093,
  title  = {StableSketcher: Enhancing Diffusion Model for Pixel-based Sketch Generation via Visual Question Answering Feedback},
  author = {Jiho Park and Sieun Choi and Jaeyoon Seo and Jihie Kim},
  journal= {arXiv preprint arXiv:2510.20093},
  year   = {2026}
}

备注

Under review at IEEE Access. Author-submitted preprint. Not the IEEE-published version