中文

面向扩散 Transformer 的上下文 LoRA

计算机视觉与模式识别 2024-11-06 v3 图形学

摘要

最近的研究 arXiv:2410.15027 探索了使用扩散 Transformer (DiT) 进行任务无关的图像生成,方法是通过简单地跨图像连接注意力 token。然而,尽管消耗了大量计算资源,生成图像的保真度仍然不理想。在本研究中,我们重新评估并简化了这一框架,假设文本到图像的 DiT 天生具备上下文生成能力,只需极少的微调即可激活它们。通过多样化的任务实验,我们定性地证明了现有的文本到图像 DiT 无需任何微调即可有效执行上下文生成。基于这一洞察,我们提出了一种极其简单的流程来利用 DiT 的上下文能力:(1) 连接图像而非 token,(2) 对多张图像进行联合描述,(3) 使用小型数据集(例如 20~100 个样本)进行任务特定的 LoRA 微调,而非使用大型数据集进行全参数微调。我们将我们的模型命名为上下文 LoRA (IC-LoRA)。这种方法无需修改原始 DiT 模型,只需更改训练数据。值得注意的是,我们的流程生成了高保真度的图像集,能更好地遵循提示。尽管在微调数据方面是任务特定的,但我们的框架在架构和流程上仍然是任务无关的,为社区提供了一个强大的工具,并为产品级任务无关生成系统的进一步研究提供了宝贵的见解。我们在 https://github.com/ali-vilab/In-Context-LoRA 发布了我们的代码、数据和模型。

关键词

引用

@article{arxiv.2410.23775,
  title  = {In-Context LoRA for Diffusion Transformers},
  author = {Lianghua Huang and Wei Wang and Zhi-Fan Wu and Yupeng Shi and Huanzhang Dou and Chen Liang and Yutong Feng and Yu Liu and Jingren Zhou},
  journal= {arXiv preprint arXiv:2410.23775},
  year   = {2024}
}

备注

Tech report. Project page: https://ali-vilab.github.io/In-Context-LoRA-Page/