中文

SubZero:通过零样本个人化组合主体、风格和动作

计算机视觉与模式识别 2025-02-28 v1

摘要

扩散模型正在为生成任务(包括主体和风格的个人化组合)而日益流行。虽然扩散模型可以生成用户指定的主体在 custom风格中执行 text引导的动作,但需要 fine-tuning,且不适用于在移动设备上进行个人化。因此,越来越多地关注无调参个人化方法,如 IP-Adapters。然而,这些方法在主体和风格组合方面灵活性较差,依赖于 ControlNet,或出现 content和 style泄漏痕迹。为此,我们提出了 SubZero,一种无需 fine-tuning即可生成 any主体在 any风格中执行 any动作的新型框架。我们提出了一组新约束来增强主体和风格相似性,同时减少泄漏。此外,我们提出了在 denoising模型的 cross-attention块中引入正交化时序聚合方案,有效地将 text提示与 single主体和 style图像进行条件化。我们还提出了一种新方法,用于训练定制的 content和 style投影器,以减少 content和 style泄漏。通过大量实验,我们表明所提出的方法虽然适合在边缘设备上运行,却在主体、风格和动作组合方面显著优于最先进的作品。

关键词

引用

@article{arxiv.2502.19673,
  title  = {SubZero: Composing Subject, Style, and Action via Zero-Shot Personalization},
  author = {Shubhankar Borse and Kartikeya Bhardwaj and Mohammad Reza Karimi Dastjerdi and Hyojin Park and Shreya Kadambi and Shobitha Shivakumar and Prathamesh Mandke and Ankita Nayak and Harris Teague and Munawar Hayat and Fatih Porikli},
  journal= {arXiv preprint arXiv:2502.19673},
  year   = {2025}
}