基于少样本的模块化图像到视频适配器
计算机视觉与模式识别
2026-01-01 v2
摘要
扩散模型(DMs)最近在图像和视频生成中取得了惊人的逼真度,但其在图像动画中的应用仍有限,即使在大规模数据集上训练。两个主要挑战导致了这一现象:视频信号的高维度导致训练数据稀缺,使DMs在生成运动时倾向于记忆而非遵循提示;此外,DMs难以概括到训练集中不存在的新运动模式,尤其是使用有限的训练数据对其进行微调仍在探索中。为解决这些限制,我们提出了模块化图像到视频适配器(MIVA),一种可附加到预训练DMs上的轻量级子网络,每个网络设计用于捕获单一运动模式并通过并行实现可扩展。MIVA可在约十个样本上使用单个消费级GPU高效训练。在推理时,用户可以通过选择一个或多个MIVA来指定运动,无需进行提示工程。广泛的实验表明,MIVA实现了更精确的运动控制,同时保持或甚至超过了在显著更大数据集上训练的模型的生成质量。
引用
@article{arxiv.2512.20000,
title = {Few-Shot-Based Modular Image-to-Video Adapter for Diffusion Models},
author = {Zhenhao Li and Shaohan Yi and Zheng Liu and Leonartinus Gao and Minh Ngoc Le and Ambrose Ling and Zhuoran Wang and Md Amirul Islam and Zhixiang Chi and Yuanhao Yu},
journal= {arXiv preprint arXiv:2512.20000},
year = {2026}
}
备注
GitHub page: https://github.com/yishaohan/MIVA