AICL:面向视频扩散模型的动作上下文学习
计算机视觉与模式识别
2024-08-26 v2
摘要
开放域视频生成模型受限于训练视频数据集的规模,一些不太常见的动作仍无法生成。一些研究者探索视频编辑方法,通过编辑同一动作视频的空间信息来实现动作生成。然而,这种方法机械地生成相同动作而缺乏理解,与开放域场景的特性不符。本文提出 AICL,通过上下文学习赋予生成模型理解参考视频中动作信息的能力,类似于人类的做法。大量实验表明,在使用来自非训练数据集的随机选择类别时,AICL 在三种典型视频扩散模型上有效捕捉动作,并在五项指标上达到了最先进的生成性能。
引用
@article{arxiv.2403.11535,
title = {AICL: Action In-Context Learning for Video Diffusion Model},
author = {Jianzhi Liu and Junchen Zhu and Lianli Gao and Heng Tao Shen and Jingkuan Song},
journal= {arXiv preprint arXiv:2403.11535},
year = {2024}
}