中文

基于多模态条件学习复杂非刚性图像编辑

计算机视觉与模式识别 2024-12-16 v1

摘要

本文聚焦于将给定的真人(具体为单个人物图像)插入新场景的任务。我们的方法基于Stable Diffusion,能够生成自然外观的图像且在文本和姿态控制方面效果极佳。为此,我们需要训练成对图像:第一个是包含该人物的参考图像,第二个是"目标图像",显示同一人物(可能具有不同姿态和背景)。此外,我们还需要描述新姿态相对于参考图像中姿态的文本说明。本文提出了遵循上述标准的新型数据集,我们通过从人物导向和动作丰富的视频中获取成对帧,并利用多模态LLM自动总结人物姿态差异的文本说明来创建该数据集。我们表明,在野外场景中,特别是存在人物与物体交互的场景下,身份保持是一个更具挑战性的任务。将来自噪声文本描述的弱监督与稳健的2D姿态结合,可提高人物-物体交互的质量。

关键词

引用

@article{arxiv.2412.10219,
  title  = {Learning Complex Non-Rigid Image Edits from Multimodal Conditioning},
  author = {Nikolai Warner and Jack Kolb and Meera Hahn and Vighnesh Birodkar and Jonathan Huang and Irfan Essa},
  journal= {arXiv preprint arXiv:2412.10219},
  year   = {2024}
}