探索强化学习中时间步长在败血症治疗中的作用
机器学习
2025-11-27 v1 人工智能
摘要
现有研究在败血症管理领域应用强化学习(RL)时,大多遵循已确立的问题设置,即将患者数据聚合为4小时时间步长。尽管已提出对该时间步长粗糙性的担忧,认为其可能扭曲患者动态并导致次优治疗政策,但实际情况下这是否为问题仍未探讨。本文我们对四种时间步长( h)进行经验实验,通过相同的离线RL流水线进行受控比较。为确保不同时间步长间的公平比较,我们设计了动作重新映射方法,以在不同时间步长的数据集上评估政策,并在两种政策学习设置下进行跨模型选择。我们的目标是量化时间步长如何影响状态表示学习、行为克隆、政策训练和离线评估。我们的结果显示,随着学习设置的变化,的性能趋势也随之变化,而使用静态行为政策在较细时间步长( h和 h)下学习的政策整体表现最佳且稳定性最佳。我们的工作将时间步长作为离线RL在医疗保健领域的核心设计选择,并提供了支持超越传统4小时设置的替代方案的实证依据。
引用
@article{arxiv.2511.20913,
title = {Exploring Time-Step Size in Reinforcement Learning for Sepsis Treatment},
author = {Yingchuan Sun and Shengpu Tang},
journal= {arXiv preprint arXiv:2511.20913},
year = {2025}
}