中文

利用因子化动作空间实现医疗中高效的离线强化学习

机器学习 2023-05-04 v1 人工智能

摘要

许多强化学习(RL)应用具有组合动作空间,其中每个动作是子动作的组合。标准的 RL 方法忽略这种固有的因子化结构,导致可能对罕见观测到的子动作组合无法做出有意义的推断;这对于数据可能有限的离线环境尤其成问题。在这项工作中,我们提出一种由因子化动作空间诱导的线性 Q 函数分解形式。我们研究了我们方法的理论性质,确定了在使用它来近似 Q 函数时保证导致零偏差的场景。在没有理论保证的 regime 之外,我们表明我们的方法仍然有用,因为它在不必然牺牲策略最优性的情况下带来更好的样本效率,使我们能够实现更好的偏差-方差权衡。在多个使用模拟器和由医疗驱动的的真实世界数据集的离线 RL 问题中,我们证明了将因子化动作空间纳入基于价值的 RL 可以带来性能更好的策略。我们的方法可以帮助智能体在将 RL 应用于观测数据集时,在状态-动作空间未被充分探索的区域中做出更准确的推断。

关键词

引用

@article{arxiv.2305.01738,
  title  = {Leveraging Factored Action Spaces for Efficient Offline Reinforcement Learning in Healthcare},
  author = {Shengpu Tang and Maggie Makar and Michael W. Sjoding and Finale Doshi-Velez and Jenna Wiens},
  journal= {arXiv preprint arXiv:2305.01738},
  year   = {2023}
}

备注

30 pages, 18 figures, 2 tables. NeurIPS 2022. Code available at https://github.com/MLD3/OfflineRL_FactoredActions