中文

快速医疗互操作资源(FHIR)中工具调用智能体的强化学习

机器学习 2026-05-15 v1 人工智能

摘要

快速医疗互操作资源(FHIR)是医疗数据互操作交换的主导标准。在 FHIR 中,电子健康记录形成资源的有向图。在 FHIR 上回答具有临床意义的问题需要智能体执行跨多种资源类型的多步推理、过滤和聚合。先前的工作表明,即使是工具增强的 LLM 智能体(检索、代码执行、多轮规划)也经常选择错误的资源或违反遍历约束。我们在 FHIR-AgentBench 的背景下研究这个问题,这是一个基于真实世界医院数据的现实问答基准,并将 FHIR 上的推理构建为可查询结构图上的顺序决策问题。我们实现了一个多轮 CodeAct 智能体,并使用自定义测试套件和工具通过强化学习对其进行后训练。LLM Judge 提供基于执行的奖励。与基于提示的闭源模型基线相比,RL 后训练在执行数据完整性约束的同时提高了性能。在经验上,我们的方法使用更小、更便宜的 Qwen3-8B 模型将 FHIR-AgentBench 上的回答正确率从 50%(o4-mini)提高到 77%。我们提出了一种端到端后训练流水线(环境构建、测试套件构造、模型训练和自定义评估),能够可靠地改善结构化临床图上的多轮推理。

关键词

引用

@article{arxiv.2605.14126,
  title  = {Reinforcement Learning for Tool-Calling Agents in Fast Healthcare Interoperability Resources (FHIR)},
  author = {Marius S. Knorr and Robert Müller and Jan P. Bremer and Nils Schweingruber},
  journal= {arXiv preprint arXiv:2605.14126},
  year   = {2026}
}