中文

随机博弈中带奖励机的强化学习

计算与语言 2023-05-30 v1

摘要

我们研究具有复杂任务的多智能体强化学习,其中奖励函数是非马尔可夫的。我们利用奖励机来融入复杂任务的高层知识。我们开发了一种称为随机博弈中带奖励机的Q学习(QRM-SG)的算法,以学习各智能体在纳什均衡下的最佳响应策略。在QRM-SG中,我们定义了增广状态空间中纳什均衡处的Q函数。增广状态空间整合了随机博弈的状态与奖励机的状态。每个智能体学习系统中所有智能体的Q函数。我们证明,若学习过程中每步阶段博弈具有全局最优点或鞍点,且智能体基于该点处的最佳响应策略更新Q函数,则QRM-SG中学得的Q函数收敛至纳什均衡处的Q函数。我们使用Lemke-Howson方法由当前Q函数导出最佳响应策略。三个案例研究表明QRM-SG能有效学习最佳响应策略。案例研究I中QRM-SG约7500回合、案例研究II中1000回合、案例研究III中1500回合后学到最佳响应策略,而基线方法如Nash Q-learning和MADDPG在所有三个案例研究中均未能收敛至纳什均衡。

关键词

引用

@article{arxiv.2305.17371,
  title  = {Towards Better Entity Linking with Multi-View Enhanced Distillation},
  author = {Yi Liu and Yuan Tian and Jianxun Lian and Xinlong Wang and Yanan Cao and Fang Fang and Wen Zhang and Haizhen Huang and Denvy Deng and Qi Zhang},
  journal= {arXiv preprint arXiv:2305.17371},
  year   = {2023}
}

备注

Accepted by ACL 2023 Main Conference