中文

基于策略所访问状态对智能体的通用刻画

人工智能 2021-10-29 v3 神经与进化计算

摘要

决策智能体或其策略的行为刻画(BC)被用于研究训练算法的结果,并作为算法本身的一部分以鼓励独特策略、匹配专家策略或限制每次更新的策略改变。然而,先前提出的方案由于表达力不足、计算限制或对策略或环境的约束,并不能普遍适用。此外,许多 BC 依赖于策略的动作。我们讨论并展示了这些 BC 如何具有误导性,尤其在随机环境中,并提出了一种基于策略所访问状态的新型解决方案。我们运行实验来评估所提 BC 相对于基线的质量,并评估它们在研究训练算法、新颖性搜索和信赖域策略优化中的用途。代码可在 https://github.com/miffyli/policy-supervectors 获取。

关键词

引用

@article{arxiv.2012.01244,
  title  = {General Characterization of Agents by States they Visit},
  author = {Anssi Kanervisto and Tomi Kinnunen and Ville Hautamäki},
  journal= {arXiv preprint arXiv:2012.01244},
  year   = {2021}
}

备注

Deep Reinforcement Learning Workshop, NeurIPS 2021