中文

引导与方差校正融合结合一次性风格对齐用于大内容图像生成

计算机视觉与模式识别 2025-02-11 v2 人工智能

摘要

使用小型扩散模型生成大图像越来越受欢迎,因为训练大型模型的成本可能过高。一种常见的方法是联合生成一系列重叠的图像块,并通过合并相邻块来获得大图像。然而,现有方法的结果通常表现出明显的伪影,例如接缝以及不一致的对象和风格。为了解决这些问题,我们提出了引导融合(GF),通过对重叠区域应用加权平均来减轻远距离图像区域的负面影响。此外,我们提出了方差校正融合(VCF),它在平均后校正数据方差,为去噪扩散概率模型生成更准确的融合。此外,我们提出了一次性风格对齐(SA),通过调整初始输入噪声来为大图像生成一致的风格,而无需增加额外的计算负担。大量实验表明,所提出的融合方法显著提高了生成图像的质量。所提出的方法可以广泛用作即插即用模块,以增强其他基于融合的大图像生成方法。代码:https://github.com/TitorX/GVCFDiffusion

关键词

引用

@article{arxiv.2412.12771,
  title  = {Guided and Variance-Corrected Fusion with One-shot Style Alignment for Large-Content Image Generation},
  author = {Shoukun Sun and Min Xian and Tiankai Yao and Fei Xu and Luca Capriotti},
  journal= {arXiv preprint arXiv:2412.12771},
  year   = {2025}
}