先行动后测量:面向具有主动测量能力的部分可观测环境的强化学习
人工智能
2023-03-16 v1 机器学习
摘要
我们研究马尔可夫决策过程(MDPs),其中智能体直接控制何时以及如何收集信息,这由动作依存无噪可观测MDPs(ACNO-MPDs)所形式化。在这些模型中,动作由两部分组成:影响环境的控制动作,以及影响智能体可观测内容的测量动作。为解决ACNO-MDPs,我们引入先行动后测量(ATM)启发式,其假设在选择控制动作时可忽略未来的状态不确定性。我们展示了遵循该启发式如何缩短策略计算时间,并证明了该启发式所带来的性能损失上界。为决定是否采取测量动作,我们引入测量价值的概念。我们基于ATM启发式开发了一种强化学习算法,使用适用于部分可观测领域的Dyna-Q变体,并在多个部分可观测环境中展示了其相对于先前方法的优越性能。
引用
@article{arxiv.2303.08271,
title = {Act-Then-Measure: Reinforcement Learning for Partially Observable Environments with Active Measuring},
author = {Merlijn Krale and Thiago D. Simão and Nils Jansen},
journal= {arXiv preprint arXiv:2303.08271},
year = {2023}
}
备注
Accecpted at ICAPS 2023