中文

智能体探索良好动作之外的环境以改进模型从而实现更优决策

人工智能 2023-06-07 v1 机器学习

摘要

提升智能体的决策能力是迈向人工智能道路上的关键挑战。为改进做出良好决策所需的规划技能,MuZero 的智能体将网络模型的预测与基于预测进行树搜索的规划相结合。当预测不佳但规划又依赖预测时,MuZero 的学习过程可能失败。我们将此作为动力,让智能体探索其在环境中原本不会探索的决策树部分。智能体通过以下方式实现这一点:首先进行常规规划以得出改进的策略;其次,在每次训练回合开始时随机偏离该策略;第三,在随机时间步切换回改进策略,以体验与改进策略相关的环境奖励,这是学习正确价值期望的基础。我们使用简单的棋盘游戏井字棋来说明该方法如何提升智能体的决策能力。完全用 Java 编写的源代码可在 https://github.com/enpasos/muzero 获取。

关键词

引用

@article{arxiv.2306.03408,
  title  = {Agents Explore the Environment Beyond Good Actions to Improve Their Model for Better Decisions},
  author = {Matthias Unverzagt},
  journal= {arXiv preprint arXiv:2306.03408},
  year   = {2023}
}

备注

Submitted to NeurIPS 2023