中文

Sissi:基于语义-风格集成的零样本风格引导图像合成

计算机视觉与模式识别 2026-01-13 v1

摘要

文本引导的图像生成技术近年来取得了快速进展,但实现对视觉示例的精确风格化仍然困难。现有方法常依赖任务特定的 retraining 或高成本的 inversion 操作,这会损害内容完整性、降低风格保真度,并导致语义提示遵循与风格对齐之间不令人满意的权衡。本文提出一种无需 training 的框架,将风格引导合成重新定义为上下文学习任务。受文本语义提示指导,我们的方法将参考风格图像与掩码目标图像拼接起来,利用预训练的 ReFlow-based 修复模型,通过多模态注意力融合无缝地将语义内容与所需风格集成。我们进一步分析了多模态注意力融合中固有的不平衡性和噪声敏感性,提出动态语义-风格集成(DSSI)机制,对文本语义和风格视觉标记之间的注意力进行重新加权,有效解决指导冲突并增强输出连贯性。实验表明,我们的方法在保持语义-风格平衡和视觉质量方面实现了高保真度风格化,提供了一个简单而强大的替代方案,以克服复杂且易产生伪影的先前方法。

关键词

引用

@article{arxiv.2601.06605,
  title  = {Sissi: Zero-shot Style-guided Image Synthesis via Semantic-style Integration},
  author = {Yingying Deng and Xiangyu He and Fan Tang and Weiming Dong and Xucheng Yin},
  journal= {arXiv preprint arXiv:2601.06605},
  year   = {2026}
}