OmniConsistency: 从配对风格化数据学习风格无关的一致性
计算机视觉与模式识别
2025-05-27 v1
摘要
扩散模型极大地推进了图像风格化,但仍有两个核心挑战持续存在:(1) 在复杂场景中保持一致的风格化,特别是身份、构图和细节,以及 (2) 在使用风格 LoRA 的图像到图像流水线中防止风格退化。GPT-4o 卓越的风格化一致性凸显了开源方法与专有模型之间的性能差距。为缩小这一差距,我们提出 **OmniConsistency**,一个利用大规模扩散Transformer (DiTs) 的通用一致性插件。OmniConsistency 的贡献包括:(1) 一个基于对齐图像对训练的上下文一致性学习框架,以实现鲁棒的泛化;(2) 一种两阶段渐进学习策略,将风格学习与一致性保持解耦,以缓解风格退化;以及 (3) 一个完全即插即用的设计,兼容 Flux 框架下的任意风格 LoRA。大量实验表明,OmniConsistency 显著增强了视觉连贯性和美学质量,达到了与商业最先进模型 GPT-4o 相当的性能。
引用
@article{arxiv.2505.18445,
title = {OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data},
author = {Yiren Song and Cheng Liu and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2505.18445},
year = {2025}
}