通过强化学习与博弈论相互作用建模网络物理人机系统
多智能体系统
2019-10-14 v1 机器学习
摘要
预测具有多人类交互的网络物理系统的结果是一个具有挑战性的问题。本文综述了一种解决该问题的博弈论方法,其中采用强化学习预测时间扩展的交互动力学。我们阐明,该方法最具吸引力的特征在于提出了一种计算可行的方法,将多个人类同时建模为决策者,而非确定感兴趣智能体的决策动力学并强迫其他个体服从环境施加的某些运动学与动力学约束。我们给出该方法最近的两项应用以建模 1)无人机融入国家空域系统以及 2)公路交通。我们以正在进行及未来的工作(关于采用、改进与验证该方法)作结,并给出相关的开放问题与研究机遇。
引用
@article{arxiv.1910.05092,
title = {Modeling Cyber-Physical Human Systems via an Interplay Between Reinforcement Learning and Game Theory},
author = {Mert Albaba and Yildiray Yildiz},
journal= {arXiv preprint arXiv:1910.05092},
year = {2019}
}