通过文本引导视频生成学习通用策略
人工智能
2023-11-21 v3
摘要
人工智能的一个目标是构建一个能够解决多种任务的智能体。近期文本引导图像合成取得的进展已产生具有生成复杂新颖图像强大能力的模型,展现出跨领域的组合泛化。受此成功启发,我们探究此类工具是否可用于构建更通用的智能体。具体而言,我们将序列决策问题转化为文本条件视频生成问题:给定编码所需目标的文本规范,规划器合成一组描绘其未来规划动作的未来帧,随后从生成视频中提取控制动作。通过利用文本作为底层目标规范,我们得以自然且组合式地泛化至新目标。所提出的策略即视频表述可进一步以统一的图像空间表示具有不同状态和动作空间的环境,例如,其实现了跨多种机器人操作任务的学习与泛化。最后,通过利用预训练语言嵌入和互联网上广泛可用的视频,该方法可通过为真实机器人预测高度逼真的视频规划实现知识迁移。
引用
@article{arxiv.2302.00111,
title = {Learning Universal Policies via Text-Guided Video Generation},
author = {Yilun Du and Mengjiao Yang and Bo Dai and Hanjun Dai and Ofir Nachum and Joshua B. Tenenbaum and Dale Schuurmans and Pieter Abbeel},
journal= {arXiv preprint arXiv:2302.00111},
year = {2023}
}
备注
NeurIPS 2023, Project Website: https://universal-policy.github.io/