中文

RxEval:评估 LLM 药物推荐能力的处方级基准

机器学习 2026-05-15 v1 人工智能

摘要

住院药物推荐要求临床医生随着患者病情的进展,反复选择特定的药物、剂量和给药途径。现有的基准将此任务表述为基于多热诊断和手术代码输入的粗粒度药物代码入院级预测,未能捕捉真实处方中每个时间点信息丰富的特性。我们提出了 RxEval,一个通过多项选择题评估 LLM 处方能力的处方级基准:每个问题呈现详细的患者档案和时间顺序的临床轨迹,要求从真实处方以及通过推理链扰动生成的特定患者干扰项中选择特定的药物-剂量-途径三元组。RxEval 包含 1,547 个问题,涵盖 584 名患者、18 个诊断类别和 969 种独特药物。对 16 个 LLM 的评估表明,RxEval 既具挑战性又具区分度:各模型的 F1 分数介于 45.18 到 77.10 之间,最佳精确匹配率仅为 46.10%。错误分析显示,即使是前沿模型也可能忽略陈述的患者信息,并无法得出临床结论。

关键词

引用

@article{arxiv.2605.14543,
  title  = {RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation},
  author = {Shuhao Chen and Weisen Jiang and Changmiao Wang and Xiaoqing Wu and Xuanren Shi and Yu Zhang and James T. Kwok},
  journal= {arXiv preprint arXiv:2605.14543},
  year   = {2026}
}