中文

Mod-Adapter:通过调制适配器实现无需微调且多概念通用的个性化

计算机视觉与模式识别 2026-02-23 v4

摘要

个性化文本到图像生成旨在合成用户提供概念在多样化情境下的图像。尽管近期在多概念个性化方面取得进展,但大多数方法局限于物体概念,难以自定义抽象概念(如姿态、光照)。部分方法开始探索支持抽象概念的多概念个性化,但需为每个新概念进行测试时微调,既耗时又易在有限训练图像上过拟合。本文提出一种无需微调即可实现多概念个性化的新方法,能有效自定义物体与抽象概念。该方法基于预训练扩散转换器(DiT)中的调制机制,利用调制空间的局部性和语义意义特性。具体而言,我们提出了 Mod-Adapter 模块,用于预测与调制过程相关文本标记的概念特定调制方向。它引入视觉-语言跨注意力机制提取概念视觉特征,并采用 Mixture-of-Experts(MoE)层自适应将概念特征映射到调制空间。为缓解概念图像空间与调制空间之间的巨大鸿沟导致的训练困难,我们引入 VLM 指导的预训练策略,利用视觉语言模型的强大图像理解能力提供语义监督信号。为全面比较,我们扩展了标准基准,纳入抽象概念。我们的方法在多概念个性化任务中实现最新性能,凭借定量、定性及人类评估得到充分验证。

关键词

引用

@article{arxiv.2505.18612,
  title  = {Mod-Adapter: Tuning-Free and Versatile Multi-concept Personalization via Modulation Adapter},
  author = {Weizhi Zhong and Huan Yang and Zheng Liu and Huiguo He and Zijian He and Xuesong Niu and Di Zhang and Guanbin Li},
  journal= {arXiv preprint arXiv:2505.18612},
  year   = {2026}
}

备注

Accepted by ICLR 2026, project page: https://weizhi-zhong.github.io/Mod-Adapter