中文

语言控制扩散:通过空间、时间与任务的高效扩展

机器学习 2024-12-10 v4 人工智能 计算与语言

摘要

训练通用智能体在多个维度上都很困难,需要我们处理高维输入(空间)、长时序(时间)以及对新任务的泛化。近期架构上的进展使得沿其中一或两个轴的扩展有所改善,但使用起来在计算上仍难以承受。本文中,我们提出利用语言控制扩散模型作为以语言为条件的分层规划器(LCD)来应对所有三个轴。我们有效且高效地将扩散模型扩展到扩展的时间、状态和任务维度上进行规划,以解决以自然语言指令为条件的长时序控制问题,作为迈向通用智能体的一步。在 CALVIN 语言机器人基准上将 LCD 与其他最先进模型比较,发现 LCD 在多任务成功率上优于其他 SOTA 方法,同时相较其他可比扩散模型将推理速度提升 3.3 倍至 15 倍。我们表明 LCD 能成功利用扩散模型独特优势生成连贯的长程规划,同时解决其在生成底层细节与控制上的弱点。

关键词

引用

@article{arxiv.2210.15629,
  title  = {Language Control Diffusion: Efficiently Scaling through Space, Time, and Tasks},
  author = {Edwin Zhang and Yujie Lu and Shinda Huang and William Wang and Amy Zhang},
  journal= {arXiv preprint arXiv:2210.15629},
  year   = {2024}
}

备注

ICLR 2024, Project and code available at https://github.com/ezhang7423/language-control-diffusion