HealthCraft:面向急诊医学的强化学习安全环境
摘要
前沿语言模型正快速部署至临床工作流程中,远快于评估它们安全性的基础设施。静态医学问答基准缺失了在急诊医学中真正关心的失效模式:轨迹级安全崩溃、工具滥用以及在持续临床压力下的屈服。我们提出HealthCraft,这是第一个面向强化学习的公共环境,奖励机制在真实的急诊医学条件下衡量轨迹级安全性,其灵感来源于Corecraft。该环境基于FHIR R4世界状态,包含14种实体类型与3,987个种子实体,暴露24个MCP工具,并定义双层评分标准:任何安全关键准则被违反时即零奖励。我们发布195个任务,涵盖六大类别,针对2,255个二元准则(其中515个为安全关键)进行评估;后续扩展10个负例任务,使总数达到205个任务与2,337个准则。V8版本结果显示,Claude Opus在Pass@1上达24.8% [21.5-28.4],GPT-5.4为12.6% [10.2-15.6],安全失效率分别为27.5%与34.0%。在多步骤工作流程——最接近真实急诊护理的场景——性能几乎归零(Claude仅1.0%,GPT-5.4为0.0%),尽管单独步骤表现有时竞争力。v2至v8之间修复的六项基础设施缺陷改变了哪个模型“看起来更强”,证明基础设施保真度是衡量标准的一部分。我们引入确定性LLM裁判器以限定评估噪声,60次负例烟雾试验显示奖励信号并非即插即用即可用于训练:约束准则通过率为0.929,属于可接受的评估容忍度,但不适用于训练奖励。我们按Corecraft第5.2节方法构建与Megatron+SGLang+GRPO循环耦合,训练奖励消融留作未来工作。该环境、任务、评分标准及评估工具以Apache 2.0许可证发布。
引用
@article{arxiv.2605.21496,
title = {HealthCraft: A Reinforcement Learning Safety Environment for Emergency Medicine},
author = {Brandon Dent},
journal= {arXiv preprint arXiv:2605.21496},
year = {2026}
}
备注
16 pages, 5 figures, 6 tables. Code, task suite, and Docker bundle: https://github.com/GOATnote-Inc/healthcraft