UniCustom:面向多参考图像生成的统一视觉条件化
计算机视觉与模式识别
2026-05-14 v2
摘要
多参考图像生成旨在从文本指令合成图像,同时忠实保留来自多个参考图像的主体身份。现有VLM增强扩散模型常依赖解耦视觉条件化:语义ViT特征由VLM处理以理解指令,而外观丰富的VAE特征则在扩散主干后注入。尽管设计直观,但这种分离使得模型难以将每个语义导向的主体与正确参考图像的视觉细节关联。结果是,模型可能识别出指及的主体,但无法保留其身份和细粒度外观,导致在复杂多参考场景中出现属性泄漏和跨参考混淆。为此,我们提出UniCustom,一种统一视觉条件化框架,将ViT和VAE特征在VLM编码前融合。这种早期融合使VLM同时暴露语义线索和外观丰富细节,使其隐藏状态能够仅通过轻量级线性融合层联合编码所指主体及其对应视觉外观。为学习此类统一表示,我们采用两阶段训练策略:以重建为导向的预训练保留参考特定外观细节于融合隐藏状态中,随后在单参考和多参考生成任务上进行监督微调。我们进一步引入slot级绑定规则,鼓励每个图像槽保留其对应参考的低级细节,从而减少跨参考 entanglement。实验在两个多参考生成基准上表明,UniCustom在主体一致性、指令遵循和构图忠诚度方面均显著优于强基准。
引用
@article{arxiv.2605.12088,
title = {UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation},
author = {Yiyan Xu and Qiulin Wang and Wenjie Wang and Yunyao Mao and Xintao Wang and Pengfei Wan and Kun Gai and Fuli Feng},
journal= {arXiv preprint arXiv:2605.12088},
year = {2026}
}