中文

纯探索在 POMDP 中的极限:观测熵的足够性

机器学习 2024-06-19 v1

摘要

马尔可夫决策过程(MDP)中的纯探索问题被建模为最大化由智能体策略诱导的状态分布熵的优化问题,该目标已被广泛研究。然而,针对在部分可观测情形下的状态熵最大化几乎未受关注,尽管后者在实际应用中广泛存在,例如金融和机器人领域,智能体仅接收到真实状态控制系统动力学的噪声观测。在这些领域中,如何解决状态熵最大化问题?本文研究一种简单方法:用观测熵代替真实隐状态熵。首先,我们给出近似真实状态熵的下界和上界,仅取决于观测函数的某些属性。随后,我们表明,仅凭对观测函数的认识,就可以利用后者来计算一种对观测熵进行原则化正则化,以提升性能。通过本工作,我们为将状态熵最大化技术拓展至 POMDP 设置提供了灵活方法,并对其内在极限进行了理论表征。

关键词

引用

@article{arxiv.2406.12795,
  title  = {The Limits of Pure Exploration in POMDPs: When the Observation Entropy is Enough},
  author = {Riccardo Zamboni and Duilio Cirino and Marcello Restelli and Mirco Mutti},
  journal= {arXiv preprint arXiv:2406.12795},
  year   = {2024}
}