中文

大语言模型在药物管理中的表现:三项性能分析

计算与语言 2025-10-15 v2 人工智能

摘要

目的:大语言模型(LLM)在某些诊断任务中表现良好,但针对其在给定诊断下推荐合适药物方案的一致性进行评估的研究仍有限。药物管理是一项复杂任务,需要综合药物剂型和完整的用药指令以确保安全使用。本文测试了基于 ChatGPT 提供的 GPT-4o 这一大语言模型在三项药物管理任务中的性能。方法:我们使用三项药物任务测试 GPT-4o 的性能:识别给定药品通用名称的可用剂型、识别给定药物方案的药物-药物相互作用(DDI)、为给定药品通用名称准备药物处方。对于每个实验,均准确捕获模型返回的原始文本响应,并通过临床评估外加若干标准 LLM 指标(包括术语频率-逆文档频率(TF-IDF)向量、归一化 Levenshtein 相似度以及召回-导向-概述评估(ROUGE 1/ROUGE L F1))计算每个响应与其参考字符串之间的相似度。结果:对于药物-剂型匹配的第一项任务,GPT-4o 对通用药品匹配到所有可用剂型的准确率为49%,每种药品平均有1.23个遗漏、1.14个幻觉。对于第二项药物-药物相互作用识别任务,准确率为54.7%。对于第三项任务,GPT-4o 生成的处方句子在无药物或缩写错误的案例中占65.8%。结论:基本药物任务的模型性能始终较差。本次评估凸显了通过临床标注数据集进行领域特定训练以及建立全面评估框架进行性能基准测试的必要性。

关键词

引用

@article{arxiv.2509.22926,
  title  = {Large language models management of medications: three performance analyses},
  author = {Kelli Henry and Steven Xu and Kaitlin Blotske and Moriah Cargile and Erin F. Barreto and Brian Murray and Susan Smith and Seth R. Bauer and Xingmeng Zhao and Adeleine Tilley and Yanjun Gao and Tianming Liu and Sunghwan Sohn and Andrea Sikora},
  journal= {arXiv preprint arXiv:2509.22926},
  year   = {2025}
}