中文

EasyRef:通过多模态大语言模型实现扩散模型对多参考图像的通用化

计算机视觉与模式识别 2024-12-13 v1

摘要

个人化扩散模型取得了显著成果。传统的无调参方法大多通过对多个参考图像的嵌入求平均来实现注入条件,但这种图像无关的操作无法在多个参考图像之间进行交互,从而捕获一致的视觉元素。虽然基于低秩适应(LoRA)的调参方法在训练过程中能够有效提取多个图像中的一致元素,但需要针对每个不同的图像组合进行特定微调。本文提出了EasyRef,一种新颖的即插即用式适应方法,使扩散模型能够同时接受多个参考图像和文本提示。为有效利用多个图像中的一致视觉元素,我们利用多模态大语言模型(MLLM)的多图像理解与指令跟随能力,通过提示词捕获一致的视觉元素。此外,通过适配器将MLLM的表示注入扩散过程,可轻松实现对未见域的泛化,挖掘未知数据中一致的视觉元素。为缓解计算成本并增强细粒度细节保留,我们引入了高效的参考聚合策略和渐进式训练方案。最后,我们提出了MRBench,即一个新的多参考图像生成基准。实验结果表明,EasyRef超越了IP-Adapter等无调参方法以及LoRA等调参方法,实现了卓越的审美质量和跨域的零样本泛化。

关键词

引用

@article{arxiv.2412.09618,
  title  = {EasyRef: Omni-Generalized Group Image Reference for Diffusion Models via Multimodal LLM},
  author = {Zhuofan Zong and Dongzhi Jiang and Bingqi Ma and Guanglu Song and Hao Shao and Dazhong Shen and Yu Liu and Hongsheng Li},
  journal= {arXiv preprint arXiv:2412.09618},
  year   = {2024}
}

备注

Tech report