中文

基于模型的 actor-critic:GAN(模型生成器)+ DRL(actor-critic)=> AGI

人工智能 2021-04-22 v9 机器学习

摘要

我们的努力旨在将 GAN 和 DRL 算法统一为一个通用 AI 模型(AGI 或通用人工智能或人工通用智能,其具有通用应用:(A) 离线学习(对存储数据),如 GAN 在(无/半/全)监督学习设定中,如大数据 analytics(挖掘)与可视化;(B) 在线学习(对真实或模拟设备),如 DRL 在 RL 设定中(有/无环境奖励),如(真实或模拟)机器人与控制;我们的核心提议是向 actor-critic(无模型)架构添加一个(生成/预测)环境模型,从而形成带时序差分(TD)误差和情景记忆的基于模型的 actor-critic 架构。所提 AI 模型类似于(无模型)DDPG,因此称为基于模型的 DDPG。为评估它,我们将其与(无模型)DDPG 比较,将二者应用于 OpenAI Gym 和 Unity Agents 中多种(广泛范围)独立的模拟机器人与控制任务环境。我们初步的有限实验表明,基于模型的 actor-critic 中的 DRL 和 GAN 产生了解决各任务所需的增量目标驱动智能,性能与(无模型)DDPG 相近。我们未来的重点是研究所提 AI 模型的潜力以:(A) 通过在性能上媲美最佳的基于模型(PlaNet)与无模型(D4PG)方法,统一 AI 内部的 DRL 领域;(B) 通过学习示范奖励函数解决奖励工程重要问题,弥合 AI 与机器人社区间的鸿沟。

关键词

引用

@article{arxiv.2004.04574,
  title  = {Model-based actor-critic: GAN (model generator) + DRL (actor-critic) => AGI},
  author = {Aras Dargazany},
  journal= {arXiv preprint arXiv:2004.04574},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:1610.01945, arXiv:1903.04411, arXiv:1910.01007 by other authors