具有显式上下文表示的深度强化学习
机器学习
2023-10-17 v1
摘要
强化学习(RL)在解决复杂计算问题方面已展现出卓越能力。然而,大多数 RL 算法缺乏一种显式方法以从上下文信息中学习。人类利用上下文来识别环境中各元素间的模式与关系,以及如何避免做出错误动作。另一方面,从人类视角看显然错误的决策,RL 智能体可能需数百步才能学会避免。本文提出一种用于离散环境的框架,称为 Iota 显式上下文表示(IECR)。该框架使用上下文关键帧(CKF)表示每个状态,进而可提取表示状态可供性(affordances)的函数;此外,针对状态的可供性引入了两个损失函数。IECR 框架的新颖性在于其能从环境中提取上下文信息并从 CKF 表示中学习。我们通过开发四种利用上下文学习的新算法来验证该框架:Iota 深度 Q 网络(IDQN)、Iota 双重深度 Q 网络(IDDQN)、Iota 对决深度 Q 网络(IDuDQN)和 Iota 对决双重深度 Q 网络(IDDDQN)。此外,我们在五个离散环境中评估该框架与新算法。我们表明,所有使用上下文信息的算法在约 40,000 次神经网络训练步内收敛,显著优于其最先进的对应算法。
引用
@article{arxiv.2310.09924,
title = {Deep Reinforcement Learning with Explicit Context Representation},
author = {Francisco Munguia-Galeano and Ah-Hwee Tan and Ze Ji},
journal= {arXiv preprint arXiv:2310.09924},
year = {2023}
}
备注
Manuscript accepted for publication as regular paper in IEEE Transactions on Neural Networks and Learning Systems