中文

负样本引导的主体保真度优化用于零样本主体驱动生成

计算机视觉与模式识别 2025-10-01 v2 人工智能

摘要

我们提出主体保真度优化(SFO),一种用于零样本主体驱动生成的新型对比学习框架,旨在增强主体保真度。仅依赖正样本并使用扩散损失进行微调的现有监督微调方法,往往难以捕捉细粒度的主体细节。为解决此问题,SFO引入额外的合成负样本,并通过成对比较明确引导模型偏好正样本而非负样本。对于负样本,我们提出条件退化负样本采样(CDNS),通过引入受控退化自动生成针对主体驱动生成的合成负样本,在无需昂贵人工标注的情况下强调主体保真度和文本对齐。此外,我们对扩散时间步进行重加权,使微调聚焦于主体细节显现的中间步骤。大量实验表明,结合CDNS的SFO在主体驱动生成基准上,在主体保真度和文本对齐两方面均显著优于近期强基线。项目页面:https://subjectfidelityoptimization.github.io/

关键词

引用

@article{arxiv.2506.03621,
  title  = {Negative-Guided Subject Fidelity Optimization for Zero-Shot Subject-Driven Generation},
  author = {Chaehun Shin and Jooyoung Choi and Johan Barthelemy and Jungbeom Lee and Sungroh Yoon},
  journal= {arXiv preprint arXiv:2506.03621},
  year   = {2025}
}