中文

medR:基于三驱动潜在函数的临床离线强化学习奖励工程

机器学习 2026-02-05 v2

摘要

强化学习(RL)提供了一种优化动态治疗方案(DTRs)的强大框架。然而,临床RL fundamentally 受限于奖励工程:即在复杂、稀疏的离线环境中定义安全且有效引导策略学习的信号。现有方法往往依赖手动启发式方法,难以在不同病灶之间普遍适用。为此,我们提出了一个自动化管道,利用大型语言模型(LLM)进行离线奖励设计和验证。我们将奖励函数构建为由三种核心组件组成的潜在函数:生存、置信和能力。我们进一步引入量化指标,对奖励结构进行严格评估和筛选,以选择最佳奖励结构再部署。通过集成LLM驱动的领域知识,该框架自动为特定疾病设计奖励函数,同时显著提升所得策略的性能。

关键词

引用

@article{arxiv.2602.03305,
  title  = {medR: Reward Engineering for Clinical Offline Reinforcement Learning via Tri-Drive Potential Functions},
  author = {Qianyi Xu and Gousia Habib and Feng Wu and Yanrui Du and Zhihui Chen and Swapnil Mishra and Dilruk Perera and Mengling Feng},
  journal= {arXiv preprint arXiv:2602.03305},
  year   = {2026}
}