PLACID:基于视频扩散与合成轨迹实现身份保持的多目标合成
计算机视觉与模式识别
2026-02-03 v1 人工智能
摘要
近期生成式AI的进展显著提升了照片级图像合成的真实感,但在工作室级多目标合成方面仍有不足。该任务需要同时实现 (i) 完美保留每个物体的身份信息, (ii) 精确的背景与颜色保真, (iii) 布局与设计元素的控制,以及 (iv) 完整且吸引人的画面展示所有物体。然而,当前的SOTA模型常常会改变物体细节、遗漏或重复物体,以及生成布局错误的相对大小或不一致的物体呈现。为弥合这一差距,我们引入PLACID框架,将一组物体图像转化为吸引人的多目标合成图像。我们的主要贡献有二:其一,我们利用预训练的图像到视频(I2V)扩散模型配合文本控制,利用视频的时序先验来保留物体的一致性、身份信息以及背景细节。其二,我们提出一种新颖的数据策展策略,生成包含随机放置物体平滑移动至目标位置的合成序列。此类合成数据与视频模型的时序先验相吻合,可在训练期间实现对齐。推理阶段,初始随机位置的物体始终会受文本引导收敛至连贯的布局,最终帧即为合成图像。大量定量评估和用户研究表明,PLACID在多目标合成方面超越了SOTA方法, 在身份、背景和颜色保留方面具有优势,遗漏物体更少,呈现效果更具吸引力。
引用
@article{arxiv.2602.00267,
title = {PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories},
author = {Gemma Canet Tarrés and Manel Baradad and Francesc Moreno-Noguer and Yumeng Li},
journal= {arXiv preprint arXiv:2602.00267},
year = {2026}
}