从视频和仿真学习面向行动与推理的图像编辑
计算机视觉与模式识别
2024-10-18 v3
摘要
图像编辑模型应能够执行多样化的编辑,从对象替换、更改属性或风格,到执行动作或运动,这些都需要多种形式的推理。当前的通用指令导向编辑模型在行动和推理导向的编辑方面存在显著不足。对象、属性或风格化的变化可以从视觉静态数据集中学习。另一方面,面向行动和推理导向的编辑高质量数据稀缺,必须来自完全不同的来源,这些来源涵盖了例如物理动力学、时序性和空间推理。为此,我们精心策划了AURORA数据集(面向行动-推理-对象-属性的编辑),该数据集由视频和仿真引擎收集和精心策划的高质量训练数据的集合。我们关注训练数据的关键方面:三元组(源图像、提示、目标图像)包含由提示描述的单一有意义视觉变化,即源图像和目标图像之间真正的最小变化。为展示数据集的价值,我们在新的专家策划基准(AURORA-Bench)上评估了AURORA微调模型,覆盖8种多样化的编辑任务。我们的模型在人类评审员评估下显著优于以往的编辑模型。对于自动评估,我们发现以往指标在语义困难的编辑任务中存在重要缺陷,并警示其用于此类任务。相反,我们提出了一种新的自动评估指标,侧重于判别性理解。我们希望我们的努力:(1)策划高质量训练数据集和评估基准,(2)开发关键评估,(3)发布领先的模型,能够推动通用图像编辑领域的进一步进展。
引用
@article{arxiv.2407.03471,
title = {Learning Action and Reasoning-Centric Image Editing from Videos and Simulations},
author = {Benno Krojer and Dheeraj Vattikonda and Luis Lara and Varun Jampani and Eva Portelance and Christopher Pal and Siva Reddy},
journal= {arXiv preprint arXiv:2407.03471},
year = {2024}
}
备注
NeurIPS 2024 (Dataset & Benchmarks)