WorldGPT:一种受 Sora 启发、从文本与图像输入构建丰富世界模型的视频 AI Agent
计算机视觉与模式识别
2024-03-14 v1 人工智能
摘要
几种文本到视频扩散模型已经展示了在合成高质量视频内容方面的出色能力。然而,在保持生成序列的时间一致性和确保动作平滑性方面仍然是一个艰巨的挑战。在本文中,我们提出了一种创新的视频生成 AI agent,它利用受 Sora 启发的多模态学习的力量,基于文本提示和附带图像构建熟练的世界模型框架。该框架包括两部分:提示增强器和全视频转换。第一部分利用 ChatGPT 的能力,为每个后续步骤精心提炼并主动构建精确的提示,从而保证提示通信的最高准确性以及在后续模型操作中的准确执行。第二部分采用与现有先进扩散技术兼容的方法,扩展地生成并优化视频结尾处的关键帧。然后,我们可以熟练地利用首尾关键帧的力量,制作具有增强时间一致性和动作平滑性的视频。实验结果证实,与其他方法相比,我们的方法在从文本和图像输入构建世界模型方面具有很强的有效性和新颖性。
引用
@article{arxiv.2403.07944,
title = {WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs},
author = {Deshun Yang and Luhui Hu and Yu Tian and Zihao Li and Chris Kelly and Bang Yang and Cindy Yang and Yuexian Zou},
journal= {arXiv preprint arXiv:2403.07944},
year = {2024}
}
备注
11 pages, 2 figures, 2 tables