直接注意力损失调整优先经验回放
机器学习
2023-11-27 v1 人工智能
摘要
优先经验回放(PER)通过人为改变相对重要样本被访问的频率,使模型更多地学习这些样本。然而,这种非均匀采样方法改变了原本用于估计 Q 值函数的状态-动作分布,从而带来估计偏差。本文提出一种名为直接注意力损失调整优先经验回放(DALAP)的新型离策略强化学习训练框架,该框架可通过并行自注意力网络直接量化偏移分布的改变程度,从而精确补偿误差。此外,同时设计了优先级激励机制以优化样本筛选准则,并进一步提高训练效率。为验证 DALAP 的有效性和通用性,我们分别将其与基于值函数、基于策略梯度以及多智能体强化学习算法相集成。多组对比实验表明,DALAP 在提高收敛速度和降低训练方差方面具有显著优势。
引用
@article{arxiv.2311.14390,
title = {Directly Attention Loss Adjusted Prioritized Experience Replay},
author = {Zhuoying Chen and Huiping Li and Zhaoxu Wang},
journal= {arXiv preprint arXiv:2311.14390},
year = {2023}
}