使用贝叶斯优化的 AI 决策者自适应仿真训练
机器学习
2017-08-01 v2 人工智能
机器人学
机器学习
摘要
本研究探讨了具有可调决策参数的 AI 控制空战智能体如何学习优化对抗智能敌方时的性能,该性能由在模拟空战交战中评估的随机目标函数来衡量。我们开发了高斯过程贝叶斯优化 (GPBO) 技术以自动学习全局高斯过程 (GP) 代理模型,该模型在参数空间的已探索和未探索区域均提供统计性能预测。这使得学习引擎能够在最有可能优化性能的参数值处采样全战斗仿真,同时为改进未来预测提供高信息量的数据点。然而,标准的 GPBO 方法无法为空战中高度波动的目标函数提供可靠的代理模型,因此无法可靠地识别全局最大值。这些问题通过新颖的重复采样 (RS) 和混合重复/多点采样 (HRMS) 技术得到了解决。仿真研究表明,HRMS 提高了 GP 代理模型的准确性,使 AI 决策者能够更准确地预测性能并高效地调整参数。
引用
@article{arxiv.1703.09310,
title = {Adaptive Simulation-based Training of AI Decision-makers using Bayesian Optimization},
author = {Brett W. Israelsen and Nisar Ahmed and Kenneth Center and Roderick Green and Winston Bennett},
journal= {arXiv preprint arXiv:1703.09310},
year = {2017}
}
备注
submitted to JAIS for review