中文

AlignedGen:跨生成图像风格的对齐

计算机视觉与模式识别 2025-09-23 v1

摘要

尽管扩散模型在生成能力方面表现突出,但在条件化相同风格提示后难以维持图像间的风格一致性,这限制了其在创意工作流程中的实际应用。虽然已有多种无训练方法试图解决此问题,但这些方法局限于U-Net架构,不仅导致生成质量低且出现物体重复等瑕疵,还使其无法与更优越的扩散转换器(DiT)兼容。为此,我们提出AlignedGen,一种新颖的无训练框架,用于增强DiT模型生成图像的风格一致性。我们的工作首先揭示了一个关键洞察:在DiT中,简单地共享注意力机制因不恰当的位置嵌入导致的位置信号冲突而失效。我们引入移位位置嵌入(ShiftPE),通过为每个图像分配非重叠的位置索引来解决此冲突。基于此基础,我们开发了高级注意力共享(AAS),由三项精心设计的技术构成,充分发挥注意力共享在DiT中的潜力。此外,为拓展方法的适用性,我们提供了一种高效的查询、键和值特征提取算法,使方法能够无缝将外部图像作为风格参考纳入其中。大量实验结果表明,我们的方法在保持精确文本到图像对齐的同时,有效提升了生成图像间的风格一致性。

关键词

引用

@article{arxiv.2509.17088,
  title  = {AlignedGen: Aligning Style Across Generated Images},
  author = {Jiexuan Zhang and Yiheng Du and Qian Wang and Weiqi Li and Yu Gu and Jian Zhang},
  journal= {arXiv preprint arXiv:2509.17088},
  year   = {2025}
}