MoA:面向个性化图像生成的注意力混合模型
计算机视觉与模式识别
2024-05-07 v2 人工智能
图形学
摘要
我们提出一种新的文本到图像扩散模型个性化架构,称为注意力混合模型 (Mixture-of-Attention, MoA)。受大型语言模型 (LLM) 中注意力专家机制的启发,MoA 将生成工作负载分配给两个注意力路径:一个是个性化分支,另一个是非个性化先验分支。MoA 通过固定先验分支中的注意力层来保留原始模型的先验能力,同时通过 minimally 干预的方式进行生成,个性化分支学习将主体嵌入由先验分支生成的布局和上下文中。一个新颖的路由机制管理这些分支之间每层像素的分布,以优化个性化和通用内容创建的混合。训练完成后,MoA 能够创建高质量的个性化图像,图像中包含多个主体,其构图和相互作用多样性与原始模型生成的一致。关键地说,MoA 增强了模型先前能力与新型个性化干预之间的区分,为之前无法实现的更加解缄的主体-上下文控制提供了可能。项目页面: https://snap-research.github.io/mixture-of-attention
引用
@article{arxiv.2404.11565,
title = {MoA: Mixture-of-Attention for Subject-Context Disentanglement in Personalized Image Generation},
author = {Kuan-Chieh Wang and Daniil Ostashev and Yuwei Fang and Sergey Tulyakov and Kfir Aberman},
journal= {arXiv preprint arXiv:2404.11565},
year = {2024}
}
备注
Project Website: https://snap-research.github.io/mixture-of-attention, Same as previous version, only updated metadata because bib was missing an author name