中文

探索带观测代价的优化控制

机器学习 2020-06-30 v1 人工智能

摘要

在医疗强化学习文献中当前有一种趋势:为了准备临床数据集,研究者会将未施测检查的末次结果——即末次观测向前携带(LOCF)值——向前填充以填补空缺,并假设其仍准确指示患者当前状态。这些值被向前携带而未保留关于其如何被插补的确切信息,导致歧义。我们的方法使用 OpenAI Gym 的 Mountain Car 对这一问题建模,旨在解决何时观测患者生理状态以及部分如何干预,因为我们假定只能在观测之后采取行动。迄今我们发现,对于状态空间的 LOCF 实现,用追踪自末次观测以来时间的各状态变量计数器扩充状态,可改善智能体的预测性能,支持了“信息性缺失”的概念;并且使用基于神经网络的动力学模型预测非观测状态变量最可能的下一状态值,而非通过 LOCF 向前携带末次观测值,进一步提升了智能体性能,带来更快收敛与更小方差。

关键词

引用

@article{arxiv.2006.15757,
  title  = {Exploring Optimal Control With Observations at a Cost},
  author = {Rui Aguiar and Nikka Mofid and Hyunji Alex Nam},
  journal= {arXiv preprint arXiv:2006.15757},
  year   = {2020}
}

备注

8 pages, 10 figures