中文

零样文风插入:跨域对象组成的零样生成框架

计算机视觉与模式识别 2026-04-28 v2

摘要

基于参考的对象组成涉及将前景参考图像与背景场景集成以产生和谐的融合图像。这一任务在跨域场景中尤为具有挑战性,因为模型必须在保持参考对象身份的同时将其与风格化环境和谐化。这个 under-explored 的问题目前被实用的 "blenders"(缺乏生成保真度)和 "generators"(需要不切实际的 per-subject 在线微调)所分割。本文我们引入 Insert In Style,第一个既实用又高保真度的零样生成框架。我们的核心贡献是具备两个关键创新:(i) 一个新颖的多阶段训练协议,用于分离用于身份、风格和组成的表示;(ii) 一个专用的掩码注意力架构,用于在生成期望地手术地强制这种分离;(iii) 一个保持已学习的身份和风格先验完整的 prior 保持目标。通过设计,这种方法缓解了在统一注意力架构中典型的概念干扰,同时确保对 diverse references 和 styles 的 robust generalization。我们的框架在一个新建构的 115k 样本数据集上进行训练,该数据集来自一个新颖的数据管道。这个管道将大规模生成与严格的、迭代的人类在环过滤过程相结合,以确保高保真语义身份和风格连贯性。与先前工作不同,我们的模型是 truly 零样的,不需要文本提示。我们还引入了一个新的公共基准用于风格化组成。我们展示了在身份和风格指标上显著优于现有方法的性能,该结果得到用户研究的强有力证据支持。

关键词

引用

@article{arxiv.2511.15197,
  title  = {Insert In Style: A Zero-Shot Generative Framework for Harmonious Cross-Domain Object Composition},
  author = {Raghu Vamsi Chittersu and Yuvraj Singh Rathore and Pranav Adlinge and Kunal Swami},
  journal= {arXiv preprint arXiv:2511.15197},
  year   = {2026}
}