中文

AlphaZeroES:直接得分最大化优于规划损失最小化

人工智能 2024-06-14 v1

摘要

在执行时进行规划已被证明能显著提升智能体在单智能体和多智能体环境中的性能。一类著名的执行时规划方法是AlphaZero及其变体,它们使用蒙特卡洛树搜索以及一个神经网络,该网络通过预测状态值和动作概率来引导搜索。AlphaZero通过最小化规划损失来训练这些网络,该损失使价值预测与回合回报匹配,并使搜索树根部的策略预测与完整树展开的输出匹配。AlphaZero已成功应用于单智能体环境(如推箱子)和多智能体环境(如国际象棋和围棋)。在本文中,我们探讨了一个有趣的问题:在单智能体环境中,我们能否通过直接最大化回合得分(而非最小化此规划损失)来超越AlphaZero,同时保持MCTS算法和神经架构不变?为了直接最大化回合得分,我们使用了进化策略,这是一类用于零阶黑箱优化的算法。我们的实验表明,在多个环境中,直接最大化回合得分优于最小化规划损失。

关键词

引用

@article{arxiv.2406.08687,
  title  = {AlphaZeroES: Direct score maximization outperforms planning loss minimization},
  author = {Carlos Martin and Tuomas Sandholm},
  journal= {arXiv preprint arXiv:2406.08687},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2308.08693