马尔可夫决策过程中组合性、模块化与可解释性的统一理论
机器学习
2025-06-12 v1 人工智能
摘要
我们为一种新的无奖励马尔可夫决策过程提出选项核贝尔曼方程(OKBEs)。与价值函数不同,OKBEs直接构建并优化一种称为状态-时间选项核(STOK)的预测映射,以最大化完成目标的概率同时避免约束违反。STOK是强化学习选项框架中策略的具有组合性、模块化和可解释性的起始至终止转换核。这意味着:1)STOK可通过查普曼-科尔莫戈罗夫方程进行组合,以对多个策略在长时间范围内的时空预测进行建模;2)高维STOK可以以因子化和可重构形式高效表示和计算;3)STOK记录了语义上可解释的目标成功和约束违反事件的概率,这是形式化验证所需的。给定一个用于不可解规划问题的高维状态转换模型,我们可以将其分解为局部STOK和以目标为条件的策略,并将它们聚合为一个因子化目标核,从而能够在高维层面以目标为单位进行前向规划以求解问题。这些特性带来了高度灵活的智能体,能够快速合成元策略、跨多个任务复用规划表示,并使用赋能(一种内在动机函数)来为目标提供论证。我们认为奖励最大化与组合性、模块化和可解释性的特性相冲突。相反,OKBEs促进了这些特性,以支持可验证的长时间范围规划和可扩展至动态高维世界模型的内在动机。
引用
@article{arxiv.2506.09499,
title = {A Unified Theory of Compositionality, Modularity, and Interpretability in Markov Decision Processes},
author = {Thomas J. Ringstrom and Paul R. Schrater},
journal= {arXiv preprint arXiv:2506.09499},
year = {2025}
}
备注
12 Pages