WHBench:基于专家循环验证评估前沿大语言模型在女性健康主题上的表现
计算与语言
2026-04-02 v1 人工智能
计算机与社会
摘要
大语言模型越来越多地用于医疗指导,但女性健康在基准设计中仍被低估。我们提出了女性健康基准(WHBench),一个包含47个专家设计的场景的针对性评估套件,涵盖10个女性健康主题,旨在暴露具有临床意义的失败模式,包括过时的指南、不安全的遗漏、剂量错误和与公平性相关的盲点。我们使用一个涵盖临床准确性、完整性、安全性、沟通质量、指令遵循、公平性、不确定性处理和指南遵循的23项标准评分体系,结合安全加权惩罚和服务器端分数重算,评估了22个模型。在3102次尝试的响应中(3100个被评分),没有模型的平均表现超过75%;最佳模型达到72.1%。即使是最优模型也显示出低完全正确率和实质性的伤害率差异。响应标签层面的评分者间一致性为中等,但模型排名的一致性较高,支持WHBench用于比较系统评估的效用,同时凸显了临床部署中专家监督的必要性。WHBench提供了一个公开的、面向失败模式的基准,用于追踪女性健康AI更安全、更公平的发展。
引用
@article{arxiv.2604.00024,
title = {WHBench: Evaluating Frontier LLMs with Expert-in-the-Loop Validation on Women's Health Topics},
author = {Sneha Maurya and Pragya Saboo and Girish Kumar},
journal= {arXiv preprint arXiv:2604.00024},
year = {2026}
}