无模型领域中的欺骗式强化学习
人工智能
2023-03-21 v1 多智能体系统
摘要
本文研究无模型且连续动作空间领域中用于隐私保护的欺骗式强化学习。在强化学习中,奖励函数定义了智能体的目标。在对抗场景下,智能体可能既需最大化奖励,又需对其奖励函数向观察者保密。近期研究提出模糊性模型(AM),通过预训练的 函数,在一组可能奖励函数上选择模糊动作。尽管在基于模型的领域取得了有前景的结果,我们的研究表明 AM 因状态空间探索方向偏差而在无模型领域无效。其训练效率低下且不适用于连续动作空间领域。我们提出欺骗式探索模糊性模型(DEAM),在训练中使用欺骗策略,从而实现对状态空间的有针对性探索。DEAM 亦适用于连续动作空间。我们在离散与连续动作空间路径规划环境中评估 DEAM。DEAM 取得了与基于模型的最优 AM 版本相近的性能,并在路径代价、欺骗性与训练效率上优于无模型的 AM 版本。这些结果可推广至连续领域。
引用
@article{arxiv.2303.10838,
title = {Deceptive Reinforcement Learning in Model-Free Domains},
author = {Alan Lewis and Tim Miller},
journal= {arXiv preprint arXiv:2303.10838},
year = {2023}
}
备注
8 pages, 1 reference page, 4 appendix pages, Accepted into International Conference on Automated Planning and Scheduling (ICAPS) 2023