中文

面向成本敏感决策的强化学习

机器学习 2024-10-08 v1 人工智能

摘要

许多现实情境下的决策允许在数据有限或不确定时获取额外的相关信息。然而,传统的强化学习方法要么要求所有特征在决策前就获取完毕(如 MDP),要么视部分特征为无法获取的缺失数据(如 POMDP)。本文考虑能够主动从环境获取特征以提高决策质量和确定性的强化学习模型,同时自动平衡特征获取过程的成本与任务决策过程的奖励。我们提出了主动获取 POMDP (AA-POMDP) 模型,并识别了两种不同应用领域的获取过程类型。为帮助智能体在主动获取的部分观测环境中作出决策,并缓解探索-开发的困境,我们发展了一种基于模型的方法,利用深度生成模型捕获特征之间的依赖关系并对未观测特征进行插值。这些插值本质上代表了智能体的信念。结合动态模型,我们开发了分层强化学习算法来解决这两种 AA-POMDP。实证结果表明,我们的方法在性能上显著优于现有的 POMDP-RL 解决方案。

关键词

引用

@article{arxiv.2410.03892,
  title  = {Towards Cost Sensitive Decision Making},
  author = {Yang Li and Junier Oliva},
  journal= {arXiv preprint arXiv:2410.03892},
  year   = {2024}
}