中文

AlphaZero 对最优、模型预测与自适应控制的启示

最优化与控制 2023-01-05 v2 人工智能

摘要

本文旨在提供分析与洞见(通常基于可视化),以解释在线决策在离线训练之上的有益效果。特别是,通过一个统一的抽象数学框架,我们展示了 AlphaZero/TD-Gammon 在值空间近似与 rollout 方面的核心思想,可广泛应用于确定性与随机性最优控制问题,涉及离散与连续搜索空间。此外,这些思想可以有效地与其他重要方法论相结合,如模型预测控制、自适应控制、分散控制、离散与贝叶斯优化、基于神经网络的值与策略近似,以及用于离散优化的启发式算法。

关键词

引用

@article{arxiv.2108.10315,
  title  = {Lessons from AlphaZero for Optimal, Model Predictive, and Adaptive Control},
  author = {Dimitri Bertsekas},
  journal= {arXiv preprint arXiv:2108.10315},
  year   = {2023}
}

备注

A far more extensive version with the same title was published in 2022 in book format, with confusion resulting