中文

马尔可夫决策过程中的几何主动探索:抽象的优势

机器学习 2024-07-19 v1

摘要

科学家如何使用强化学习(RL)算法来设计对动态系统状态空间的实验?在有限且马尔可夫的系统中,活动探索(AE)将实验设计的优化问题拓展为凸形RL,这是一种容纳更广泛奖励概念的RL泛化。不幸的是,该框架目前不可扩展,AE的潜力受制于科学发现应用中典型的庞大实验空间。然而,这些空间常常具备天然几何结构(例如分子设计中的排列不变性),代理人可利用这些结构来提高AE的统计和计算效率。为实现此目标,我们桥接AE与MDP同构,后者提供了通过抽象化利用已知几何结构的途径。为此目标,我们作出两个根本性贡献:我们将MDP同构正式推广到凸形RL,并提出了对样本效率而言抽象化获益的首个正式分析。最终,我们提出几何主动探索(GAE)算法,该算法在以科学发现问题为动机的环境中进行理论和实验分析。

关键词

引用

@article{arxiv.2407.13364,
  title  = {Geometric Active Exploration in Markov Decision Processes: the Benefit of Abstraction},
  author = {Riccardo De Santi and Federico Arangath Joseph and Noah Liniger and Mirco Mutti and Andreas Krause},
  journal= {arXiv preprint arXiv:2407.13364},
  year   = {2024}
}

备注

ICML 2024