中文

AICL:面向视频扩散模型的动作上下文学习

计算机视觉与模式识别 2024-08-26 v2

摘要

开放域视频生成模型受限于训练视频数据集的规模,一些不太常见的动作仍无法生成。一些研究者探索视频编辑方法,通过编辑同一动作视频的空间信息来实现动作生成。然而,这种方法机械地生成相同动作而缺乏理解,与开放域场景的特性不符。本文提出 AICL,通过上下文学习赋予生成模型理解参考视频中动作信息的能力,类似于人类的做法。大量实验表明,在使用来自非训练数据集的随机选择类别时,AICL 在三种典型视频扩散模型上有效捕捉动作,并在五项指标上达到了最先进的生成性能。

关键词

引用

@article{arxiv.2403.11535,
  title  = {AICL: Action In-Context Learning for Video Diffusion Model},
  author = {Jianzhi Liu and Junchen Zhu and Lianli Gao and Heng Tao Shen and Jingkuan Song},
  journal= {arXiv preprint arXiv:2403.11535},
  year   = {2024}
}