中文

Q-Cogni:一个集成的因果强化学习框架

机器学习 2023-02-28 v1 人工智能

摘要

我们提出 Q-Cogni,一个算法上集成的因果强化学习框架,其通过自主因果结构发现方法重新设计 Q-Learning,以利用因果推断改进学习过程。Q-Cogni 利用预学习的环环境结构因果模型实现最优学习,该模型可在学习过程中被查询,以推断嵌入于状态-动作空间中的因果关系。我们借助强化学习的样本高效技术,能够对更广泛策略进行推理,并为强化学习智能体的决策带来更高程度的可解释性。我们将 Q-Cogni 应用于车辆路径问题(VRP),并与最先进的强化学习算法进行比较。我们报告的结果展示了更优的策略、改进的学习效率以及智能体决策更强的可解释性。我们还将该方法与传统最短路径搜索算法比较,展示了我们的因果强化学习框架对高维问题的益处。最后,我们利用纽约市出租车与礼车委员会行程记录数据,将 Q-Cogni 应用于推导出租车的最优路径决策,并与最短路径搜索比较,报告的结果显示在实际领域中有 85% 的案例由 Q-Cogni 导出相等或更好的策略。

关键词

引用

@article{arxiv.2302.13240,
  title  = {Q-Cogni: An Integrated Causal Reinforcement Learning Framework},
  author = {Cris Cunha and Wei Liu and Tim French and Ajmal Mian},
  journal= {arXiv preprint arXiv:2302.13240},
  year   = {2023}
}

备注

9 pages, 10 figures, 2 algorithms