中文

从机器人到脓毒症治疗:基于几何悲观主义的离线强化学习

机器学习 2026-02-17 v2

摘要

离线强化学习有望从静态数据集中恢复最优策略,但仍易高估分布外动作,尤其是在断裂且稀疏的数据流形上。现有解决方案需要在计算效率与性能之间进行权衡。CQL 等方法提供了严格的保守性,但需要巨大的计算能力,而高效的基于期望值的方法(如 IQL)通常无法纠正病态数据集上的分布外误差,退化为行为克隆。在这项工作中,我们提出了几何悲观主义,这是一个模块化、计算高效的框架,它通过基于状态-动作嵌入空间中 k-近邻距离的密度惩罚来增强标准 IQL。通过预先计算应用于每个状态-动作对的惩罚,我们的方法通过奖励塑形以 O(1) 的训练开销将分布外保守性注入训练循环。在 D4RL MuJoCo 基准测试上,我们的方法 Geo-IQL 在敏感且不稳定的 medium-replay 任务上比标准 IQL 高出 18 分以上,同时将种子间标准差降低了 4 倍。此外,Geo-IQL 在稳定流形上不会降低性能。关键的是,我们在 MIMIC-III 脓毒症重症监护数据集上验证了我们的算法。当标准 IQL 退化为行为克隆时,Geo-IQL 展示了主动的策略改进。在维持安全约束的同时,它与临床医生的最终一致性达到 86.4%,而 IQL 为 75%。我们的结果表明,几何悲观主义提供了必要的正则化,以安全地克服关键现实世界决策系统中的局部最优。

关键词

引用

@article{arxiv.2602.08655,
  title  = {From Robotics to Sepsis Treatment: Offline RL via Geometric Pessimism},
  author = {Sarthak Wanjari},
  journal= {arXiv preprint arXiv:2602.08655},
  year   = {2026}
}

备注

10 pages, 8 figures