边学边做:非平稳马尔可夫决策过程中的自适应决策
人工智能
2024-01-23 v3 机器学习
摘要
序贯决策中一个根本性(且很大程度上尚未解决的)挑战是处理非平稳环境,即外生环境条件随时间变化。此类问题传统上被建模为非平稳马尔可夫决策过程(NSMDP)。然而,现有的NSMDP决策方法存在两个主要缺陷:第一,它们假设当前时刻更新后的环境动态是已知的(尽管未来动态可能变化);第二,规划在很大程度上是悲观的,即智能体采取“安全”行动以应对环境的非平稳演化。我们认为这两个假设在实践中均不成立——更新后的环境条件很少是已知的,而且随着智能体与环境交互,它可以学习更新后的动态并避免悲观,至少在对其动态有信心的状态下如此。我们提出了一种名为自适应蒙特卡洛树搜索(ADA-MCTS)的启发式搜索算法来应对这些挑战。我们证明智能体可以随时间学习环境的更新动态,然后边学边做,即如果智能体处于其拥有更新知识的状态空间区域,它可以避免悲观。为了量化“更新知识”,我们将智能体更新信念中的偶然不确定性与认知不确定性进行分解,并展示智能体如何利用这些估计进行决策。我们将所提出的方法与多个公认开源问题中的多种最先进决策方法进行比较,并通过实验证明我们的方法速度更快、高度自适应且不牺牲安全性。
引用
@article{arxiv.2401.01841,
title = {Act as You Learn: Adaptive Decision-Making in Non-Stationary Markov Decision Processes},
author = {Baiting Luo and Yunuo Zhang and Abhishek Dubey and Ayan Mukhopadhyay},
journal= {arXiv preprint arXiv:2401.01841},
year = {2024}
}
备注
Accepted for publication at the International Conference on Autonomous Agents and MultiAgent Systems (AAMAS), 2024