Sora: 大型视觉模型的背景、技术、局限性与机遇综述
计算机视觉与模式识别
2024-04-19 v3 人工智能
机器学习
摘要
Sora 是由 OpenAI 在 2024 年 2 月发布的文本到视频生成式 AI 模型。该模型在文本指令下生成真实或富有想象力的场景视频,显示出模拟物理世界的潜力。基于公开技术报告和逆向工程,本文综述了 Sora 的背景、相关技术、应用、剩余挑战以及文本到视频 AI 模型的未来方向。我们首先追溯 Sora 的发展,探讨构建此“世界模拟器”的底层技术。随后,详细描述了 Sora 在电影制作、教育、营销等多个行业的应用及其潜在影响。我们讨论了需要解决的主要挑战和局限性,例如确保视频生成的安全性和无偏性。最后,我们讨论了 Sora 及更广泛的视频生成模型的未来发展,以及该领域的进步如何促进新的人机交互方式,提高视频生成的生产力和创造力。
引用
@article{arxiv.2402.17177,
title = {Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models},
author = {Yixin Liu and Kai Zhang and Yuan Li and Zhiling Yan and Chujie Gao and Ruoxi Chen and Zhengqing Yuan and Yue Huang and Hanchi Sun and Jianfeng Gao and Lifang He and Lichao Sun},
journal= {arXiv preprint arXiv:2402.17177},
year = {2024}
}
备注
37 pages, 18 figures; GitHub: https://github.com/lichao-sun/SoraReview