中文

StyleAR:面向风格对齐文本到图像生成的多模态自回归模型定制

计算机视觉与模式识别 2025-05-27 v1 人工智能 多媒体

摘要

在当前的研究领域中,多模态自回归(AR)模型在视觉理解和生成等多个领域展现出了卓越的能力。然而,诸如风格对齐的文本到图像生成等复杂任务带来了重大挑战,特别是在数据获取方面。类似于 AR 模型用于图像编辑的指令微调,风格对齐生成需要一张参考风格图像和提示词,从而构成一个文本-图像到图像的三元组,其中输出共享输入的风格和语义。然而,获取大量具有特定风格的三元组数据比获取用于训练生成模型的传统文本到图像数据要困难得多。为了解决这个问题,我们提出了 StyleAR,这是一种创新的方法,它将专门设计的数据整理方法与我们所提出的 AR 模型相结合,以有效利用文本到图像的二元数据进行风格对齐的文本到图像生成。我们的方法使用参考风格图像和提示词合成目标风格化数据,但仅将目标风格化图像作为图像模态来创建高质量的二元数据。为了促进二元数据训练,我们引入了一个带有感知器重采样器的 CLIP 图像编码器,该重采样器将图像输入转换为与 AR 模型中多模态 token 对齐的风格 token,并实现了一种风格增强 token 技术来防止内容泄露,这是先前工作中常见的问题。此外,我们将从大规模文本-图像数据集中提取的原始图像与风格化图像混合,以增强 StyleAR 提取更丰富风格特征的能力并确保风格一致性。大量定性和定量实验证明了我们优越的性能。

关键词

引用

@article{arxiv.2505.19874,
  title  = {StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation},
  author = {Yi Wu and Lingting Zhu and Shengju Qian and Lei Liu and Wandi Qiao and Lequan Yu and Bin Li},
  journal= {arXiv preprint arXiv:2505.19874},
  year   = {2025}
}