中文

UnZipLoRA:从单张图像中分离内容与风格

计算机视觉与模式识别 2025-08-21 v2

摘要

本文提出 UnZipLoRA 方法,用于将图像分解为其组成要素——主体与风格,分别表示为两个 LoRA(低秩适配器)。不同于现有个性化技术仅聚焦主体或风格,或需要为每个分别准备训练集,UnZipLoRA 通过同时训练两个 LoRA 从单张图像中解耦这些元素。UnZipLoRA 确保生成的 LoRA 之间是兼容的,即可以通过直接相加进行无缝组合。UnZipLoRA 使可以独立操控和重新定位主体与风格,包括生成它们的变体、将提取的风格应用到新主体上,并重新组合以重构原始图像或创建新变体。为解决主体与风格交织的难题,UnZipLoRA 采用一种新颖的提示分离技术,以及列和块分离策略,以准确保留主体和风格特征,并确保所学习 LoRA 之间的兼容性。通过人类研究和定量指标评估,证明 UnZipLoRA 在效果上优于其他最先进的方法,包括 DreamBooth-LoRA、Inspiration Tree 和 B-LoRA。

关键词

引用

@article{arxiv.2412.04465,
  title  = {UnZipLoRA: Separating Content and Style from a Single Image},
  author = {Chang Liu and Viraj Shah and Aiyu Cui and Svetlana Lazebnik},
  journal= {arXiv preprint arXiv:2412.04465},
  year   = {2025}
}

备注

Project page: https://unziplora.github.io