强化学习中的探索与激励
机器学习
2023-02-21 v5 计算机科学与博弈论
摘要
当自利智能体偏好时,你如何激励它们去?我们考虑复杂的探索问题,其中每个智能体面临相同的(但未知的)MDP。与传统强化学习公式不同,智能体控制策略的选择,而算法只能发出建议。然而,算法控制信息流,并可通过信息不对称为智能体提供探索激励。我们设计了一种探索MDP中所有可达状态的算法。我们获得了与先前研究的静态无状态探索问题中激励探索相类似的可靠性保证。据我们所知,这是首个在具有状态的强化学习设定中考虑机制设计的工作。
引用
@article{arxiv.2103.00360,
title = {Exploration and Incentives in Reinforcement Learning},
author = {Max Simchowitz and Aleksandrs Slivkins},
journal= {arXiv preprint arXiv:2103.00360},
year = {2023}
}