中文

使用 B-LoRA 进行隐式风格-内容分离

计算机视觉与模式识别 2024-09-24 v2

摘要

图像风格化涉及操控图像的视觉外观和纹理(风格),同时保留其底层对象、结构和概念(内容)。风格与内容的分离对于独立于内容地操控图像风格至关重要,以确保和谐且视觉上令人愉悦的结果。实现这种分离需要对图像的视觉和语义特征有深刻理解,通常需要训练专门的模型或采用繁重的优化。在本文中,我们引入了 B-LoRA,一种利用 LoRA(低秩适应)来隐式分离单张图像风格与内容成分的方法,从而促进各种图像风格化任务。通过分析结合 LoRA 的 SDXL 架构,我们发现联合学习两个特定块(称为 B-LoRA)的 LoRA 权重,能够实现单独训练每个 B-LoRA 所无法达到的风格-内容分离。将训练整合到仅两个块中并分离风格与内容,可以显著改善风格操控并克服模型微调中常遇到的过拟合问题。一旦训练完成,这两个 B-LoRA 可作为独立组件使用,以实现各种图像风格化任务,包括图像风格迁移、基于文本的图像风格化、一致风格生成以及风格-内容混合。

关键词

引用

@article{arxiv.2403.14572,
  title  = {Implicit Style-Content Separation using B-LoRA},
  author = {Yarden Frenkel and Yael Vinker and Ariel Shamir and Daniel Cohen-Or},
  journal= {arXiv preprint arXiv:2403.14572},
  year   = {2024}
}

备注

Project Page: https://b-lora.github.io/B-LoRA/