中文

临床强化学习中时间抽样的潜在风险

机器学习 2026-04-30 v3

摘要

强化学习 (RL) 是一种人工智能技术,用于做出最佳选择。在医疗保健领域,研究人员通常使用离线强化学习 (ORL),该方法从回顾性观察数据中进行训练和评估。为适应临床记录中固有的不规则性,研究人员通常在训练前将数据抽样为均匀时间间隔(称为分箱)。然而,离散化后的数据为模型提供了一种虚构的临床情景表征,尤其是在决策时机不可预测的情况下。鉴于这些模型缺乏稳健的试验证据,我们选择进一步探讨这一问题的影响,通过在 30 个虚拟糖尿病患者上进行仿真临床试验。该仿真器被修改为在决策之间包含随机间隔,并用于生成用于离线强化学习的训练数据集。我们在原始数据集以及抽样为 10 分钟、2 小时和 4 小时间隔的等效数据集上训练了三个 ORL 算法。在部署到仿真环境进行测试时,发现时间抽样会使模型性能下降最高可达 60%,其中 4 小时抽样导致所有智能体的表现均低于数据集的基线。回顾性评估在抽样后的数据上主动掩盖了这一效果,预测的回报比实际情况高出 1.5-3 倍。我们建议未来的研究优先考虑具有自然临床决策间隔的数据集,这可能是这些模型在安全部署到患者护理之前所必需的步骤。

关键词

引用

@article{arxiv.2602.06603,
  title  = {The hidden risks of temporal resampling in clinical reinforcement learning},
  author = {Thomas Frost and Hrisheekesh Vaidya and Steve Harris},
  journal= {arXiv preprint arXiv:2602.06603},
  year   = {2026}
}

备注

12 pages, 6 figures, 3 tables. v3 updates with lit rev table