中文

HIVMedQA:面向 HIV 医疗决策支持的大语言模型基准测试

计算与语言 2025-07-28 v2 人工智能

摘要

大语言模型(LLMs)正在成为支持临床决策的有价值工具。HIV 管理是一个具有竞争力的应用场景,由于其复杂性,包括多样化的治疗选项、共病和依从性挑战。然而,将 LLMs 集成到临床实践中引发了关于准确性、潜在伤害和临床接受度的担忧。尽管它们具有巨大的潜力,AI 在 HIV 护理中的应用仍属未开发领域,LLM 基准测试研究亦寥寥。本 study 求评估当前 LLMs 在 HIV 管理中的能力,凸显其优势和局限性。我们引入 HIVMedQA,一个旨在评估 HIV 护理中开放式医疗问答的基准。该数据集由经筛选、具有临床相关性的问题组成,这些问题是与传染病医生合作开发的。我们评估了七个通用-purpose 和三个医学专门化的 LLMs,通过 prompt engineering 来提升性能。我们的评估框架包括 lexical similarity 和 LLM-as-a-judge 方法,后者扩展以更好地反映临床相关性。我们评估了多个维度:question comprehension、reasoning、knowledge recall、bias、potential harm 和 factual accuracy。结果显示,Gemini 2.5 Pro 在大多数维度上一致领先于其他模型。值得注意的是,前三名模型中有两款是专有模型。随着 question 复杂度的增加,性能会下降。医学 fine-tuned 模型并不总是优于通用-purpose 模型,模型大小也不是性能的可靠预测器。推理和 comprehension 比事实 recall 更具挑战性,观察到认知偏见(如 recency 和 status quo)等现象。这凸显了针对开发和评估需要以确保 LLMs 安全、有效地集成到临床护理中的目标导向。

关键词

引用

@article{arxiv.2507.18143,
  title  = {HIVMedQA: Benchmarking large language models for HIV medical decision support},
  author = {Gonzalo Cardenal-Antolin and Jacques Fellay and Bashkim Jaha and Roger Kouyos and Niko Beerenwinkel and Diane Duroux},
  journal= {arXiv preprint arXiv:2507.18143},
  year   = {2025}
}