多对多:统一多种视频与图像生成及处理任务的训练
计算机视觉与模式识别
2026-02-06 v3
摘要
扩散模型在许多视觉生成与处理任务中展现出令人瞩目的性能。许多现有方法侧重于为特定任务训练模型,尤其是文本到视频(T2V)生成,而许多其他工作则侧重于对预训练 T2V 模型进行微调,以用于图像到视频(I2V)、视频到视频(V2V)、图像与视频处理任务等。然而,训练强大的 T2V 基础模型需要大量高质量标注,成本十分高昂。此外,许多现有模型仅能执行一项或少数几项任务。本文引入了一个统一框架,即“多对多”,利用来自许多不同视觉生成与处理任务的可用训练数据,训练单一模型来完成这些不同任务。具体而言,我们设计了一个轻量级适配器以统一不同任务中的不同条件,随后采用图像-视频联合学习策略,从零开始逐步训练模型。我们的联合学习产生了一个统一的视觉生成与处理模型,并提升了视频生成性能。此外,我们引入深度图作为条件,以帮助模型在视觉生成中更好地感知 3D 空间。我们训练了两个不同模型规模(8B 和 2B)的版本,每个版本均可执行 10 项以上不同任务。特别地,与开源甚至商业引擎相比,我们的 8B 模型在视频生成任务中展现出极具竞争力的性能。模型与源代码获取自:https://github.com/leeruibin/MfM.git。
引用
@article{arxiv.2506.01758,
title = {Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks},
author = {Ruibin Li and Tao Yang and Yangming Shi and Weiguo Feng and Shilei Wen and Bingyue Peng and Lei Zhang},
journal= {arXiv preprint arXiv:2506.01758},
year = {2026}
}