中文

强化学习中的特权信息丢弃

机器学习 2020-05-20 v1 人工智能 机器学习

摘要

在训练期间使用特权信息可提升机器学习系统的样本效率与性能。这一范式已应用于强化学习(RL),主要形式为蒸馏或辅助任务,较少以扩充智能体输入的形式出现。在本工作中,我们研究特权信息丢弃(\pid)以实现后者,其可同等地应用于基于价值和基于策略的RL算法。在一个简单的部分可观测环境中,我们证明了\pid优于利用特权信息的替代方案,包括蒸馏和辅助任务,并能成功利用不同类型的特权信息。最后,我们分析了其对所学表征的影响。

关键词

引用

@article{arxiv.2005.09220,
  title  = {Privileged Information Dropout in Reinforcement Learning},
  author = {Pierre-Alexandre Kamienny and Kai Arulkumaran and Feryal Behbahani and Wendelin Boehmer and Shimon Whiteson},
  journal= {arXiv preprint arXiv:2005.09220},
  year   = {2020}
}