中文

由少到多的泛化:通过上下文生成解锁更多可控性

计算机视觉与模式识别 2025-04-04 v1 机器学习

摘要

尽管主体驱动生成因其在图像生成中的广泛应用而被广泛探索,但它在数据可扩展性和主体可扩展性方面仍面临挑战。对于第一个挑战,从构建单主体数据集转向多主体数据集并进行扩展尤为困难。对于第二个挑战,大多数最新方法集中于单主体生成,使其难以应用于多主体场景。在本研究中,我们提出了一种高一致性的数据合成流水线来应对这一挑战。该流水线利用扩散 Transformer 固有的上下文生成能力,生成高一致性的多主体配对数据。此外,我们引入了 UNO,它由渐进式跨模态对齐和通用旋转位置嵌入组成。它是一个多图像条件下的主体到图像模型,由文本到图像模型迭代训练而成。大量实验表明,我们的方法能够在单主体和多主体驱动生成中确保可控性的同时实现高一致性。

关键词

引用

@article{arxiv.2504.02160,
  title  = {Less-to-More Generalization: Unlocking More Controllability by In-Context Generation},
  author = {Shaojin Wu and Mengqi Huang and Wenxu Wu and Yufeng Cheng and Fei Ding and Qian He},
  journal= {arXiv preprint arXiv:2504.02160},
  year   = {2025}
}

备注

Project page: https://bytedance.github.io/UNO Code and model: https://github.com/bytedance/UNO