基于多模态条件学习复杂非刚性图像编辑
计算机视觉与模式识别
2024-12-16 v1
摘要
本文聚焦于将给定的真人(具体为单个人物图像)插入新场景的任务。我们的方法基于Stable Diffusion,能够生成自然外观的图像且在文本和姿态控制方面效果极佳。为此,我们需要训练成对图像:第一个是包含该人物的参考图像,第二个是"目标图像",显示同一人物(可能具有不同姿态和背景)。此外,我们还需要描述新姿态相对于参考图像中姿态的文本说明。本文提出了遵循上述标准的新型数据集,我们通过从人物导向和动作丰富的视频中获取成对帧,并利用多模态LLM自动总结人物姿态差异的文本说明来创建该数据集。我们表明,在野外场景中,特别是存在人物与物体交互的场景下,身份保持是一个更具挑战性的任务。将来自噪声文本描述的弱监督与稳健的2D姿态结合,可提高人物-物体交互的质量。
引用
@article{arxiv.2412.10219,
title = {Learning Complex Non-Rigid Image Edits from Multimodal Conditioning},
author = {Nikolai Warner and Jack Kolb and Meera Hahn and Vighnesh Birodkar and Jonathan Huang and Irfan Essa},
journal= {arXiv preprint arXiv:2412.10219},
year = {2024}
}