DCoAR: 用于个性化文本到图像生成的深入概念注入统一自回归模型
计算机视觉与模式识别
2025-12-09 v2
摘要
统一自回归 (AR) 模型在多模态理解和生成方面表现卓越,但在定制化图像生成领域的潜力尚未完全发挥。现有的统一 AR 模型定制方法面临根本性困境:适应性方法易出现过拟合且难以扩展,而概念注入范式受限于浅层注入策略,导致视觉保真度差且重新语境化受损。为此,我们提出 DCoAR,一种新的深层概念注入框架,保持完全冻结的预训练模型。DCoAR 通过 Layerwise 多模态上下文学习 (LMCL) 策略深入整合新概念,通过多方位正则化方案进行稳定化:采用 Dual Prior Preservation (DPP) 损失缓解语义漂移,采用 Context-Aware Self-Regularization (CASR) 损失增强重新语境化。该框架还支持在用户提供的风格中进行训练自由的主体定制。实验表明,DCoAR 在注入式方法中显著优于先前方法,在性能上与适应式方法相抗衡,却所需的可训练参数大幅减少。代码: https://github.com/KZF-kzf/CoAR
引用
@article{arxiv.2508.07341,
title = {DCoAR: Deep Concept Injection into Unified Autoregressive Models for Personalized Text-to-Image Generation},
author = {Fangtai Wu and Mushui Liu and Weijie He and Zhao Wang and Yunlong Yu},
journal= {arXiv preprint arXiv:2508.07341},
year = {2025}
}