基于自注意力编码与坐标保持融合的组件感知草图到图像生成
计算机视觉与模式识别
2026-03-11 v1
摘要
将自由手绘草图转化为写实图像仍是图像合成中的基础挑战,尤其由于草图的抽象、稀疏及其风格化的特性。现有方法(包括 GAN 和扩散模型)往往难以重建细粒度细节、维持空间对齐或跨域适应。在本文中,我们提出一种组件感知、自我完善框架,用于草图到图像生成,通过 novel two-stage 架构解决上述挑战。首先,基于自注意力的自编码器网络(SA2N)从组件级草图区域中捕获局部语义和结构特征;随后,坐标保持门控融合(CGF)模块将这些特征整合为连贯的空间布局。最后,基于修改版 StyleGAN2 背板的空间自适应细化修复器(SARR)通过受空间语境指导的迭代细化提升真实感和一致性。广泛的实验在面部(CelebAMask-HQ、CUFSF)和非面部(Sketchy、ChairsV2、ShoesV2)数据集上表明,我们的方法在图像保真度、语义准确性和感知质量方面均显著优于最先进的 GAN 和扩散模型。在 CelebAMask-HQ 上,我们的方法相较于先前方法实现了 21%(FID)、58%(IS)、41%(KID)和 20%(SSIM)的提升。这些结果以及更高的效率和跨多样化域的视觉连贯性,使我们的方案成为 Forensic、数字艺术修复和通用草图驱动图像合成的强有力候选方案。
引用
@article{arxiv.2603.09484,
title = {Component-Aware Sketch-to-Image Generation Using Self-Attention Encoding and Coordinate-Preserving Fusion},
author = {Ali Zia and Muhammad Umer Ramzan and Usman Ali and Muhammad Faheem and Abdelwahed Khamis and Shahnawaz Qureshi},
journal= {arXiv preprint arXiv:2603.09484},
year = {2026}
}