中文

视频作为面向现实世界决策的新语言

计算机视觉与模式识别 2024-02-28 v1 人工智能

摘要

文本和视频数据在互联网上都十分丰富,支持通过下一个标记或帧预测进行大规模自监督学习。然而,两者未得到平等的利用:语言模型已取得显著的实际应用成果,而视频生成则主要局限于媒体娱乐。然而,视频数据捕获了语言难以表达的关于物理世界的重要信息。为弥合这一差距,我们讨论了将视频生成扩展到解决现实世界任务的潜在机会。我们观察到,类似于语言,视频可作为统一的接口,吸收互联网知识并代表 diverse tasks。此外,我们演示了像语言模型一样,视频生成可作为规划器、代理、计算引擎和环境模拟器,通过技术手段如 in-context 学习、规划和强化学习实现。我们确定在机器人、自动驾驶和科学等领域的重大影响机会,支持最新工作表明,这些高级视频生成能力在技术上是可实现的。最后,我们识别了视频生成中关键的挑战,这些挑战限制了进展。解决这些挑战将使视频生成模型在更广泛的 AI 应用中,能够在语言模型之外展现出独特的价值。

关键词

引用

@article{arxiv.2402.17139,
  title  = {Video as the New Language for Real-World Decision Making},
  author = {Sherry Yang and Jacob Walker and Jack Parker-Holder and Yilun Du and Jake Bruce and Andre Barreto and Pieter Abbeel and Dale Schuurmans},
  journal= {arXiv preprint arXiv:2402.17139},
  year   = {2024}
}