利用经验分类训练非马尔可夫任务
机器学习
2023-10-19 v1 人工智能
形式语言与自动机理论
计算机科学中的逻辑
摘要
与标准强化学习(RL)模型不同,许多现实世界任务是非马尔可夫的,其奖励取决于状态历史而非仅取决于当前状态。解决非马尔可夫任务(常应用于自动驾驶、金融交易和医疗诊断等实际场景中)可能颇具挑战性。我们提出一种新颖的 RL 方法来实现以时序逻辑 LTL(有限迹上的线性时序逻辑)表达的非马尔可夫奖励。为此,我们引入一种从 LTL 到 MDP(马尔可夫决策过程)的线性复杂度编码,以利用先进的 RL 算法。然后,利用基于自动机结构(语义等价于 LTL 规范)的优先经验回放技术来改进训练过程。我们对若干增强了非马尔可夫任务的基准问题进行了实证评估,以证明我们方法的可行性与有效性。
引用
@article{arxiv.2310.11678,
title = {Using Experience Classification for Training Non-Markovian Tasks},
author = {Ruixuan Miao and Xu Lu and Cong Tian and Bin Yu and Zhenhua Duan},
journal= {arXiv preprint arXiv:2310.11678},
year = {2023}
}