用于策略识别的逆强化学习
机器学习
2021-08-03 v1 人工智能
计算机科学与博弈论
摘要
在对抗环境中,一方可通过识别对手策略获得优势。例如,在战斗游戏中,若对手策略被识别为过度激进,则可设下利用对手激进本性的陷阱。然而,对手策略并非总是明显,可能需要从其行动观测中估计。本文提出使用逆强化学习(IRL)来识别对抗环境中的策略。具体地,本工作的贡献为:1)在由三种预定义策略生成的游戏战斗数据上演示该概念;2)使用IRL实现策略识别的框架。数值实验表明,恢复出的奖励可使用多种技术识别。在本文中,恢复出的奖励被可视化展示、使用无监督学习聚类,并使用有监督学习器分类。
引用
@article{arxiv.2108.00293,
title = {Inverse Reinforcement Learning for Strategy Identification},
author = {Mark Rucker and Stephen Adams and Roy Hayes and Peter A. Beling},
journal= {arXiv preprint arXiv:2108.00293},
year = {2021}
}
备注
The paper has been accepted as a regular paper in IEEE International Conference on Systems, Man, and Cybernetics (SMC), 2021