d-Sketch:利用预训练潜在扩散模型提升草图到图像翻译的视觉保真度(无需重新训练)
图形学
2025-02-24 v1 人工智能
计算机视觉与模式识别
多媒体
图像与视频处理
摘要
图像到图像翻译中的结构引导允许对合成图像的形状进行精细控制。从用户指定的粗糙手绘草图生成高质量逼真图像是这样一种任务,旨在在条件生成过程中施加结构约束。尽管这一前提对众多内容创建和学术研究用例都很有吸引力,但由于自由手绘草图中存在显著的歧义,问题变得根本性地具有挑战性。此外,在形状一致性和真实生成之间进行权衡也为整个过程增加了复杂性。现有基于生成对抗网络 (GAN) 的方法通常利用条件 GAN 或 GAN 反向投影,常需特定数据和优化目标。近期基于去噪扩散概率模型 (DDPM) 的方法在一般图像合成中实现了代际飞跃。然而,直接在特定子任务上重新训练大规模扩散模型往往因计算要求高且数据不足而困难。本文引入一种技术,用于草图到图像翻译,利用大规模扩散模型的特征泛化能力而无需重新训练。具体而言,我们使用可学习的轻量级映射网络实现源域到目标域的潜在特征翻译。实验结果表明,所提方法在定性和定量基准测试中优于现有技术,实现了从粗糙手绘草图生成高分辨率逼真图像的能力。
引用
@article{arxiv.2502.14007,
title = {d-Sketch: Improving Visual Fidelity of Sketch-to-Image Translation with Pretrained Latent Diffusion Models without Retraining},
author = {Prasun Roy and Saumik Bhattacharya and Subhankar Ghosh and Umapada Pal and Michael Blumenstein},
journal= {arXiv preprint arXiv:2502.14007},
year = {2025}
}
备注
Accepted in The International Conference on Pattern Recognition (ICPR) 2024