中文

MegaStyle:通过一致文本到图像风格映射构建多样且可扩展的风格数据集

计算机视觉与模式识别 2026-04-21 v2

摘要

本文介绍 MegaStyle,一个新型可扩展的数据 curated pipeline,用于构建在风格内一致、跨风格多样且高质量的风格数据集。我们利用当前大型生成模型的一致文本到图像风格映射能力,这些模型可以从给定风格描述中生成同一风格下的图像。基于此基础,我们构建了一个包含 17 万风格提示和 40 万内容提示的多样且平衡的提示库,并通过内容-风格提示组合生成大规模风格数据集 MegaStyle-1.4M。拥有 MegaStyle-1.4M,我们提出风格监督对比学习来微调风格编码器 MegaStyle-Encoder,用于提取富有表现力的风格特定表示,我们还训练了一个基于 FLUX 的风格迁移模型 MegaStyle-FLUX。广泛实验表明,保持风格内一致性、跨风格多样性和高质量对于风格数据集至关重要,本文提出的 MegaStyle-1.4M 也显示其有效性。此外,在 MegaStyle-1.4M 上训练的 MegaStyle-Encoder 和 MegaStyle-FLUX 提供了可靠的风格相似度测量和通用的风格迁移能力,为风格迁移社区做出了重要贡献。更多结果可在我们的项目网站 https://jeoyal.github.io/MegaStyle/ 查看。

关键词

引用

@article{arxiv.2604.08364,
  title  = {MegaStyle: Constructing Diverse and Scalable Style Dataset via Consistent Text-to-Image Style Mapping},
  author = {Junyao Gao and Sibo Liu and Jiaxing Li and Yanan Sun and Yuanpeng Tu and Fei Shen and Weidong Zhang and Cairong Zhao and Jun Zhang},
  journal= {arXiv preprint arXiv:2604.08364},
  year   = {2026}
}

备注

project website https://jeoyal.github.io/MegaStyle/