大语言模型的女性健康基准测试
计算与语言
2025-12-22 v1 人工智能
机器学习
摘要
随着大语言模型(LLM)成为数百万用户获取健康信息的主要来源,其在女性健康领域的准确性仍亟待检验。我们引入了女性健康基准测试(WHB),这是首个专门评估大语言模型在女性健康领域表现的基准测试。我们的基准测试包含96个经过严格验证的模型测试用例,涵盖五个医学专科(妇产科、急诊医学、初级保健、肿瘤学和神经病学)、三种查询类型(患者查询、临床医生查询和证据/政策查询)以及八种错误类型(剂量/用药错误、缺失关键信息、过时指南/治疗建议、不正确的治疗建议、不正确的事实信息、缺失/不正确的鉴别诊断、遗漏紧急情况和不适当的建议)。我们评估了13种最先进的大语言模型,发现了令人担忧的差距:当前模型在女性健康基准测试上的失败率约为60%,且在不同专科和错误类型之间表现差异显著。值得注意的是,模型普遍在"遗漏紧急情况"指标上表现不佳,而GPT-5等较新的模型在避免不适当建议方面显示出显著改善。我们的发现强调AI聊天机器人尚不能完全提供可靠的女性健康建议。
引用
@article{arxiv.2512.17028,
title = {A Women's Health Benchmark for Large Language Models},
author = {Victoria-Elisabeth Gruber and Razvan Marinescu and Diego Fajardo and Amin H. Nassar and Christopher Arkfeld and Alexandria Ludlow and Shama Patel and Mehrnoosh Samaei and Valerie Klug and Anna Huber and Marcel Gühner and Albert Botta i Orfila and Irene Lagoja and Kimya Tarr and Haleigh Larson and Mary Beth Howard},
journal= {arXiv preprint arXiv:2512.17028},
year = {2025}
}
备注
15 pages, 6 Figures, 2 Tables