NSYNC:用于改进风格化文本到图像翻译的负面合成图像生成
计算机视觉与模式识别
2025-11-04 v1
摘要
当前文本条件图像生成方法虽能输出逼真的图像,但难以捕捉特定风格。仅在目标风格数据集上进行微调仍面临捕捉风格特征的困难。本文提出一种新颖的对比学习框架,以提高大型文本到图像扩散模型的风格化能力。受惊人的图像生成模型进步的启发,我们利用合成图像生成来实现我们的方案。通常,生成的合成数据与特定任务相关,主要用于扩充可用真实训练数据集。而 NSYNC 则侧重于生成用于 novel 对比训练方案的负面合成数据集,与真实正面图像一起使用。在本文提出的训练方案中,我们正向数据和负向数据分别前向传递,获得正向梯度和负向梯度。随后,我们通过减去其在负向梯度上的投影来获得正向梯度的正交分量,基于此更新参数。这种正交分量消除了正向和负向数据中共有的平凡属性,引导模型捕捉更独特的风格。在各种画家和插画师的风格上进行实验表明,我们的方法在定量和定性方面均优于基线方法。我们的代码已公开于 https://github.com/giddyyupp/NSYNC。
引用
@article{arxiv.2511.01517,
title = {NSYNC: Negative Synthetic Image Generation for Contrastive Training to Improve Stylized Text-To-Image Translation},
author = {Serkan Ozturk and Samet Hicsonmez and Pinar Duygulu},
journal= {arXiv preprint arXiv:2511.01517},
year = {2025}
}
备注
Under review