中文

利用经验分类训练非马尔可夫任务

机器学习 2023-10-19 v1 人工智能 形式语言与自动机理论 计算机科学中的逻辑

摘要

与标准强化学习(RL)模型不同,许多现实世界任务是非马尔可夫的,其奖励取决于状态历史而非仅取决于当前状态。解决非马尔可夫任务(常应用于自动驾驶、金融交易和医疗诊断等实际场景中)可能颇具挑战性。我们提出一种新颖的 RL 方法来实现以时序逻辑 LTLf_f(有限迹上的线性时序逻辑)表达的非马尔可夫奖励。为此,我们引入一种从 LTLf_f 到 MDP(马尔可夫决策过程)的线性复杂度编码,以利用先进的 RL 算法。然后,利用基于自动机结构(语义等价于 LTLf_f 规范)的优先经验回放技术来改进训练过程。我们对若干增强了非马尔可夫任务的基准问题进行了实证评估,以证明我们方法的可行性与有效性。

关键词

引用

@article{arxiv.2310.11678,
  title  = {Using Experience Classification for Training Non-Markovian Tasks},
  author = {Ruixuan Miao and Xu Lu and Cong Tian and Bin Yu and Zhenhua Duan},
  journal= {arXiv preprint arXiv:2310.11678},
  year   = {2023}
}