SIGMA:基于多属性标记的选择性交错生成
计算机视觉与模式识别
2026-02-10 v1
摘要
最近的统一模型如 Bagel 表明,配对的图像编辑数据可以有效地将多个视觉任务对齐到单个扩散变换器中。然而,这些模型仅限于单条件输入,缺乏合成来自多个异构来源结果的灵活性。我们提出了 SIGMA(Selective-Interleaved Generation with Multi-Attribute Tokens),是一个统一的后训练框架,使扩散变换器能够实现交错的多条件生成。SIGMA 引入选择性多属性标记,包括风格、内容、主体和身份标记,允许模型在交错的文本-图像序列中解释和组合多个视觉条件。通过在 Bagel 统一主干上使用 70 万交错示例进行后训练,SIGMA 支持组合编辑、选择性属性迁移和细粒度多模态对齐。广泛的实验表明,SIGMA 在多样化的编辑和生成任务中显著提升了可控性、跨条件一致性和视觉质量,尤其在组合任务上相对于 Bagel 实现了显著提升。
引用
@article{arxiv.2602.07564,
title = {SIGMA: Selective-Interleaved Generation with Multi-Attribute Tokens},
author = {Xiaoyan Zhang and Zechen Bai and Haofan Wang and Yiren Song},
journal= {arXiv preprint arXiv:2602.07564},
year = {2026}
}