RealGeneral:通过视频模型的时间序列内学习统一视觉生成
计算机视觉与模式识别
2025-07-22 v2 人工智能
摘要
在单一框架中统一多样化的图像生成任务仍是视觉生成的根本挑战。虽然大型语言模型(LLM)通过任务中立的数据和生成方式实现了统一,但现有的视觉生成模型未能满足这些原则。现有的做法要么依赖按任务划分的数据集和大规模训练,要么改造预训练图像模型,仅适用于特定任务,限制了其通用性。在本工作中,我们探索将视频模型作为统一图像生成的基础,利用其内在的时序关联建模能力。我们引入RealGeneral,一种新型框架,将图像生成重新定义为条件帧预测任务,类似于LLM中的内在学习。为弥合视频模型与条件图像对之间的差距,我们提出了:(1)统一条件嵌入模块用于多模态对齐,以及(2)统一流式DiT模块,采用解耦自适应LayerNorm和注意力掩码以减轻跨模态干扰。RealGeneral在多个重要视觉生成任务中均显示出有效性,例如在定制化生成中实现了14.5%的主体相似性提升,在canny-to-image任务中实现了10%的图像质量提升。项目页面:https://lyne1.github.io/realgeneral_web/;GitHub链接:https://github.com/Lyne1/RealGeneral
引用
@article{arxiv.2503.10406,
title = {RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models},
author = {Yijing Lin and Mengqi Huang and Shuhan Zhuang and Zhendong Mao},
journal= {arXiv preprint arXiv:2503.10406},
year = {2025}
}