随机分布提炼中的探索
机器学习
2025-05-19 v1
摘要
探索始终是在线强化学习中的关键挑战,因为智能体必须有效地探索未知环境以实现高回报。当前,主要探索算法是基于计数的方法和基于好奇心的方法,其中预测误差方法是其中具有代表性的例子。本文我们提出一种新方法,称为随机分布提炼 (RDD),该方法从正态分布中采样目标网络的输出。RDD 通过将预测网络与目标网络之间的差异明确地作为内在奖励来实现更广泛的探索。此外,通过对给定状态的目标网络输出引入随机性并将其建模为从正态分布中抽取的样本,内在奖励由两个关键组成部分界定:确保适当探索衰减的伪计数项以及解释预测器收敛的差异项。我们证明 RDD 有效地统一了计数方法和预测误差方法。它保留了高维空间中预测误差方法的优势,同时也实现了类似伪计数方法的内在奖励衰减模式。在实验部分,我们将 RDD 与更先进的方法在一系列环境中进行比较。理论分析和实验结果均确认我们方法在改进强化学习任务的在线探索方面的有效性。
关键词
引用
@article{arxiv.2505.11044,
title = {Exploration by Random Distribution Distillation},
author = {Zhirui Fang and Kai Yang and Jian Tao and Jiafei Lyu and Lusong Li and Li Shen and Xiu Li},
journal= {arXiv preprint arXiv:2505.11044},
year = {2025}
}