动态处理方案中的强化学习需要深入重新审视
机器学习
2024-06-05 v2 人工智能
摘要
在医疗环境迅速变化的背景下,离线强化学习(RL)在动态处理方案(DTRs)中的实施带来了前所未有的机遇与挑战。本position论文对当前在DTR语境下应用离线RL的现状进行了批判性审视。我们主张重新评估在DTR中应用RL的做法, citing various担忧,如评估指标不一致且可能得不到结论性结果、缺乏朴素和监督学习基线以及现有研究中对RL形式化选择的多样性。通过对超过17,000个评估实验的案例研究(基于公开可用的Sepsis数据集),我们展示了RL算法的性能会因评估指标和马尔可夫决策过程(MDP)形式化选择的不同而显著变化。令人惊讶的是,在某些情况下,受策略评估方法和奖励设计影响的随机基线可以超过RL算法。这促使我们在未来的DTR工作中更谨慎地进行政策评估和算法开发。此外,我们讨论了向更可靠的RL基于动态处理方案开发潜在的改进,并邀请社区进一步讨论。代码已公开于https://github.com/GilesLuo/ReassessDTR。
引用
@article{arxiv.2405.18556,
title = {Reinforcement Learning in Dynamic Treatment Regimes Needs Critical Reexamination},
author = {Zhiyao Luo and Yangchen Pan and Peter Watkinson and Tingting Zhu},
journal= {arXiv preprint arXiv:2405.18556},
year = {2024}
}
备注
Accepted at ICML 2024. 9 pages for main content, 34 pages in total