中文

基于搜索的多智能体学习中的策略-价值对齐与鲁棒性

人工智能 2023-02-07 v2 机器学习 多智能体系统

摘要

结合搜索与学习的大规模AI系统在博弈中已达到超人水平,但也已被证明会以出人意料的方式失效。此类模型的脆弱性限制了它们在真实部署中的效能与可信度。本工作中,我们系统研究了这样一种算法AlphaZero,并识别出与探索本质相关的两种现象。首先,我们发现了策略-价值错位的证据——对于许多状态,AlphaZero的策略与价值预测相互矛盾,揭示了其目标中精确走子选择与价值估计之间的张力。此外,我们发现AlphaZero价值函数内部的不一致性,导致其泛化能力差,尽管其策略执行的是最优策略。基于这些洞察,我们推导出VISA-VIS:一种改善AlphaZero中策略-价值对齐与价值鲁棒性的新方法。实验上,我们表明该方法将策略-价值错位最多降低76%,将价值泛化误差最多降低50%,并将平均价值误差最多降低55%。

关键词

引用

@article{arxiv.2301.11857,
  title  = {Policy-Value Alignment and Robustness in Search-based Multi-Agent Learning},
  author = {Niko A. Grupen and Michael Hanlon and Alexis Hao and Daniel D. Lee and Bart Selman},
  journal= {arXiv preprint arXiv:2301.11857},
  year   = {2023}
}

备注

9 pages, 5 figures