基于策略所访问状态对智能体的通用刻画
人工智能
2021-10-29 v3 神经与进化计算
摘要
决策智能体或其策略的行为刻画(BC)被用于研究训练算法的结果,并作为算法本身的一部分以鼓励独特策略、匹配专家策略或限制每次更新的策略改变。然而,先前提出的方案由于表达力不足、计算限制或对策略或环境的约束,并不能普遍适用。此外,许多 BC 依赖于策略的动作。我们讨论并展示了这些 BC 如何具有误导性,尤其在随机环境中,并提出了一种基于策略所访问状态的新型解决方案。我们运行实验来评估所提 BC 相对于基线的质量,并评估它们在研究训练算法、新颖性搜索和信赖域策略优化中的用途。代码可在 https://github.com/miffyli/policy-supervectors 获取。
引用
@article{arxiv.2012.01244,
title = {General Characterization of Agents by States they Visit},
author = {Anssi Kanervisto and Tomi Kinnunen and Ville Hautamäki},
journal= {arXiv preprint arXiv:2012.01244},
year = {2021}
}
备注
Deep Reinforcement Learning Workshop, NeurIPS 2021