中文

OpenSubject:利用视频派生身份与多样性先验进行主题导向图像生成与操控

计算机视觉与模式识别 2025-12-11 v2

摘要

尽管主题导向图像生成取得了显著进展,但当前模型往往偏离参考身份,难以处理包含多个主题的复杂场景。为此,我们引入OpenSubject,一个基于视频派生的大规模语料库,包含250万个样本和435万张图像,用于主题导向的生成与操控。该数据集通过四阶段管道构建,利用跨帧身份先验。(i)视频精选。我们应用分辨率和审美过滤,以获得高质量片段。(ii)跨帧主题挖掘与配对。我们利用视觉语言模型(VLM)实现类别共识、局部定位和多样性感知配对,以选择图像对。(iii)身份保留参考图像合成。我们引入基于分割图引导的outpainting,以合成主题生成的输入图像,并采用基于框引导的inpainting生成主题操控的输入图像,同时结合几何感知增强和不规则边界侵蚀。(iv)验证与描述。我们利用VLM验证合成样本,对失败样本进行重新合成(基于阶段(iii)),然后构建简短和长篇描述。此外,我们引入一个覆盖主题生成与操控的基准测试,并使用VLM评估身份保真度、提示遵循度、操控一致性和背景一致性。大量实验表明,使用OpenSubject训练可提升生成与操控性能,尤其在复杂场景中效果显著。

关键词

引用

@article{arxiv.2512.08294,
  title  = {OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation},
  author = {Yexin Liu and Manyuan Zhang and Yueze Wang and Hongyu Li and Dian Zheng and Weiming Zhang and Changsheng Lu and Xunliang Cai and Yan Feng and Peng Pei and Harry Yang},
  journal= {arXiv preprint arXiv:2512.08294},
  year   = {2025}
}