中文

MotiF:在图像动画中让文本发挥作用的运动焦点损失

计算机视觉与模式识别 2025-03-25 v2 人工智能

摘要

文本-图像到视频(TI2V)生成旨在根据文本描述从图像生成视频,亦即称为文本引导的图像动画。大多数现有方法在生成与文本提示一致的视频方面存在困难,尤其是在指定运动时。为克服这一限制,我们引入了MotiF,一种简单而有效的方法,可引导模型聚焦于运动较大的区域,从而提高文本对齐和运动生成。我们使用光流生成运动热图,并根据运动强度对损失函数进行加权。这种修改后的目标函数导致显著的改进,补充了利用运动先验作为模型输入的现有方法。此外,由于缺乏多样化的基准来评估TI2V生成,我们提出了TI2V基准数据集,包含320个图像-文本对,用于稳健的评估。我们提出了一种人类评估协议,要求评注者在两个视频中选择整体偏好,然后给出依据。在TI2V基准上的全面评估表明,MotiF在九个开源模型中超越,平均偏好达72%。TI2V基准和其他结果已发布于https://wang-sj16.github.io/motif/。

关键词

引用

@article{arxiv.2412.16153,
  title  = {MotiF: Making Text Count in Image Animation with Motion Focal Loss},
  author = {Shijie Wang and Samaneh Azadi and Rohit Girdhar and Saketh Rambhatla and Chen Sun and Xi Yin},
  journal= {arXiv preprint arXiv:2412.16153},
  year   = {2025}
}

备注

Accepted by CVPR 2025. Project page: https://wang-sj16.github.io/motif/