中文

3SGen:基于自适应任务特定记忆的统一主体、风格与结构驱动图像生成

计算机视觉与模式识别 2025-12-23 v1

摘要

最近的图像生成方法常将主体、风格和结构驱动的条件处理为孤立情况,导致特征交织且任务迁移性有限。本文提出3SGen,一个任务感知的统一框架,能够在单个模型中执行这三种条件模式。3SGen采用具备可学习语义查询的大语言模型(MLLM),以对齐文本-图像语义,同时辅以VAE分支保留细粒度视觉细节。其核心是一个自适应任务特定记忆(ATM)模块,通过轻量级门控机制及多个可扩展记忆单元,动态分离、存储和检索特定条件的先验知识,如主体的身份、风格的纹理和结构的空间布局。此设计缓解了跨任务干扰,自然扩展到组合输入。此外,我们提出3SGen-Bench,一个统一的图像驱动生成基准,包含用于评估跨任务忠实性和可控性的标准化指标。广泛的实验在我们提出的3SGen-Bench及其他公开基准上表明,我们在多样化的图像驱动生成任务中表现出优越性能。

关键词

引用

@article{arxiv.2512.19271,
  title  = {3SGen: Unified Subject, Style, and Structure-Driven Image Generation with Adaptive Task-specific Memory},
  author = {Xinyang Song and Libin Wang and Weining Wang and Zhiwei Li and Jianxin Sun and Dandan Zheng and Jingdong Chen and Qi Li and Zhenan Sun},
  journal= {arXiv preprint arXiv:2512.19271},
  year   = {2025}
}