哪些经验对你的智能体有影响?基于周转丢弃的策略迭代
机器学习
2023-05-23 v2 人工智能
摘要
在带有经验回放的强化学习(RL)中,存储在回放缓冲区中的经验会影响RL智能体的性能。关于该影响的信息对于包括经验清洗和分析在内的多种目的具有价值。估计单个经验影响的一种方法是智能体比较,但当经验数量很大时其计算代价过高。本文中,我们提出PI+ToD作为一种高效估计经验影响的方法。PI+ToD是一种策略迭代,通过利用周转丢弃(turn-over dropout)高效估计经验的影响。我们在MuJoCo环境中通过实验展示了PI+ToD的效率。
引用
@article{arxiv.2301.11168,
title = {Which Experiences Are Influential for Your Agent? Policy Iteration with Turn-over Dropout},
author = {Takuya Hiraoka and Takashi Onishi and Yoshimasa Tsuruoka},
journal= {arXiv preprint arXiv:2301.11168},
year = {2023}
}
备注
The paper is withdrawn because an error that affects the main results of the experiments has been found