中文

MotionEdit:运动中心图像编辑的基准测试与学习

计算机视觉与模式识别 2025-12-16 v2 人工智能 计算与语言

摘要

我们引入了 MotionEdit,一个用于运动中心图像编辑的新数据集——该任务是在保持身份、结构和物理合理性的同时修改主体动作与交互。与现有图像编辑数据集关注静态外观变化或仅包含稀疏、低质量运动编辑不同,MotionEdit 提供了从连续视频中提取并验证的高保真图像对,描绘了真实的运动变换。这一新任务不仅具有科学挑战性,而且具有实际意义,可驱动帧控视频合成和动画等下游应用。为评估模型在该新任务上的性能,我们引入了 MotionEdit-Bench,一个在运动中心编辑上挑战模型并以生成式、判别式和基于偏好的指标衡量模型性能的基准。基准测试结果表明,运动编辑对现有最先进的基于扩散的编辑模型而言仍然极具挑战性。为弥补这一差距,我们提出了 MotionNFT(运动引导的负感知微调),一个后训练框架,通过计算运动对齐奖励——基于输入图像与模型编辑图像之间的运动流与真实运动匹配的程度——来引导模型实现精确的运动变换。在 FLUX.1 Kontext 和 Qwen-Image-Edit 上的大量实验表明,MotionNFT 一致地提升了两个基础模型在运动编辑任务上的编辑质量和运动保真度,同时未牺牲通用编辑能力,证明了其有效性。我们的代码位于 https://github.com/elainew728/motion-edit/。

关键词

引用

@article{arxiv.2512.10284,
  title  = {MotionEdit: Benchmarking and Learning Motion-Centric Image Editing},
  author = {Yixin Wan and Lei Ke and Wenhao Yu and Kai-Wei Chang and Dong Yu},
  journal= {arXiv preprint arXiv:2512.10284},
  year   = {2025}
}

备注

Technical Report. We propose MotionEdit, a dataset and benchmark for motion-centric image editing. We also introduce MotionNFT, a reward training framework to improve existing models with motion-aware guidance. Github: https://github.com/elainew728/motion-edit/