文本到视频模型的概率适配
人工智能
2023-06-06 v1
摘要
在互联网规模数据上训练的大型文本到视频模型已展现出从任意文本描述生成高保真视频的卓越能力。然而,将这些模型适配到具有有限领域特定数据(如动画或机器人视频)的任务上构成了显著的计算挑战,因为微调预训练大模型可能极其昂贵。受小型可修改组件(如提示、前缀微调)可在无需访问模型权重的情况下使大型语言模型适应新任务的启发,我们研究了如何在不微调的情况下将大型预训练文本到视频模型适配到多种下游领域与任务。在回答该问题时,我们提出了 Video Adapter,其利用大型预训练视频扩散模型的得分函数作为概率先验,以引导任务特定的小型视频模型生成。我们的实验表明,Video Adapter 能够将大型预训练视频模型的广博知识纳入并保留其高保真度于任务特定的小型视频模型中,该模型能在动画、自我中心建模以及模拟与真实世界机器人数据建模等多种任务上生成高质量且专用的视频。更多视频可在网站 https://video-adapter.github.io/ 查看。
引用
@article{arxiv.2306.01872,
title = {Probabilistic Adaptation of Text-to-Video Models},
author = {Mengjiao Yang and Yilun Du and Bo Dai and Dale Schuurmans and Joshua B. Tenenbaum and Pieter Abbeel},
journal= {arXiv preprint arXiv:2306.01872},
year = {2023}
}
备注
Project website https://video-adapter.github.io/. First two authors contributed equally