AVID:将视频扩散模型适配为世界模型
计算机视觉与模式识别
2024-11-26 v2 机器学习
摘要
大规模生成模型在多个领域取得了显著成功。然而,对于诸如机器人技术等序列决策问题,带有动作标签的数据通常稀缺,因此扩展用于决策的基础模型仍然是一个挑战。一个潜在的解决方案在于利用广泛可用的无标签视频来训练世界模型,以模拟动作的后果。如果世界模型足够准确,它可以用于优化下游任务中的决策。图像到视频的扩散模型已经能够生成高度逼真的合成视频。然而,这些模型并非以动作为条件,且最强大的模型是闭源的,这意味着它们无法进行微调。在这项工作中,我们提出将预训练的视频扩散模型适配为以动作为条件的世界模型,而无需访问预训练模型的参数。我们的方法AVID在一个包含动作标签视频的小型领域特定数据集上训练一个适配器。AVID使用一个学习到的掩码来修改预训练模型的中间输出,并生成准确的以动作为条件的视频。我们在视频游戏和真实世界机器人数据上评估了AVID,结果表明它在扩散模型适配方面优于现有基线。我们的结果证明,如果正确利用,预训练的视频模型有潜力成为具身AI的强大工具。
引用
@article{arxiv.2410.12822,
title = {AVID: Adapting Video Diffusion Models to World Models},
author = {Marc Rigter and Tarun Gupta and Agrin Hilmkil and Chao Ma},
journal= {arXiv preprint arXiv:2410.12822},
year = {2024}
}
备注
Project Webpage: https://sites.google.com/view/avid-world-model-adapters/home