VideoAgent:用于自我改进的视频生成
人工智能
2025-02-11 v3 机器学习
摘要
视频生成被用于生成控制机器人系统的视觉计划。给定图像观察和语言指令,先前的工作生成视频计划,然后转换为机器人控制以执行。然而,利用视频生成进行控制的一个主要瓶颈在于生成视频的质量,由于幻觉内容和不真实的物理现象,导致下游控制动作提取后的任务成功率较低。虽然通过扩大数据集和模型规模可以部分解决此问题,但集成外部反馈是将视频生成 grounding 在现实世界中的自然且必不可少的手段。基于此观察,我们提出 VideoAgent 用于基于外部反馈对生成的视频计划进行自我改进。VideoAgent 首先通过一种我们称为自我条件一致性的新颖程序来细化生成的视频计划,允许推理时间计算转化为更好的生成视频计划。当细化后的视频计划被执行时,VideoAgent 可以从环境中收集额外数据,以进一步改进视频计划的生成。MetaWorld 和 iTHOR 中的仿真机器人操控实验表明,VideoAgent 大幅度减少了幻觉,从而提升了下游操控任务的成功率。我们进一步说明,VideoAgent 能够有效地细化真实机器人视频,为机器人成为 grounding 视频生成现实世界的有效工具提供了初步指示。视频演示和代码可在 https://video-as-agent.github.io 查看。
引用
@article{arxiv.2410.10076,
title = {VideoAgent: Self-Improving Video Generation},
author = {Achint Soni and Sreyas Venkataraman and Abhranil Chandra and Sebastian Fischmeister and Percy Liang and Bo Dai and Sherry Yang},
journal= {arXiv preprint arXiv:2410.10076},
year = {2025}
}