中文

拓扑经验回放

机器学习 2023-06-28 v3 人工智能

摘要

最先进的深度 Q-learning 方法使用从经验回放缓冲区采样的状态转移元组来更新 Q 值。该策略通常均匀随机采样或基于时序差分(TD)误差等度量对数据采样进行优先级排序。此类采样策略在学习 Q 函数时可能效率低下,因为一个状态的 Q 值依赖于后继状态的 Q 值。如果数据采样策略忽略下一状态 Q 值估计的精度,可能导致对 Q 值进行无用且常错误的更新。为缓解此问题,我们将智能体的经验组织为图,显式追踪状态间 Q 值的依赖关系。图中的每条边表示通过执行单个动作在两个状态间的转移。我们通过从终止状态集合开始、依次向后扩展图中顶点的广度优先搜索来执行价值备份。我们通过实验表明,在多种目标到达任务上,我们的方法比若干基线具有显著更高的数据效率。值得注意的是,所提方法也优于消耗更多批次训练经验并从图像等高维观测数据运行的基线。

关键词

引用

@article{arxiv.2203.15845,
  title  = {Topological Experience Replay},
  author = {Zhang-Wei Hong and Tao Chen and Yen-Chen Lin and Joni Pajarinen and Pulkit Agrawal},
  journal= {arXiv preprint arXiv:2203.15845},
  year   = {2023}
}