通过观察物体运动进行基于指令的图像编辑
计算机视觉与模式识别
2024-12-17 v1
摘要
本文提出了一种新颖的数据集构建流水线,该流水线从视频中采样帧对,并使用多模态大语言模型(MLLMs)生成编辑指令,用于训练基于指令的图像编辑模型。视频帧固有地保留了主体和场景的身份信息,确保了编辑过程中内容的一致性保存。此外,视频数据捕捉了多样且自然的动态——例如非刚性主体运动和复杂的摄像机运动——这些动态在其他情况下难以建模,使其成为可扩展数据集构建的理想来源。利用这种方法,我们创建了一个新数据集来训练 InstructMove,该模型能够执行基于指令的复杂编辑,而这些编辑是合成数据集难以实现的。我们的模型在调整主体姿态、重排元素和改变摄像机视角等任务中展示了 SOTA 性能。
引用
@article{arxiv.2412.12087,
title = {Instruction-based Image Manipulation by Watching How Things Move},
author = {Mingdeng Cao and Xuaner Zhang and Yinqiang Zheng and Zhihao Xia},
journal= {arXiv preprint arXiv:2412.12087},
year = {2024}
}
备注
Project page: https://ljzycmd.github.io/projects/InstructMove/