评估健康语言模型的可扩展框架
人工智能
2026-02-20 v3 计算与语言
人机交互
摘要
大型语言模型 (Large Language Models, LLMs) 已成为分析复杂数据集的强大工具。近期研究表明,LLMs 可在提供包含生活方式、生物标志物及背景信息的患者专属健康信息后,生成有用且个性化的响应。随着 LLM 驱动的健康应用日益普及,严谨且高效的单边评估方法至关重要,以确保在准确性、个性化与安全性等多个维度上维持响应质量。当前针对开放式文本响应的评估实践严重依赖人类专家,这种做法引入人为因素,往往成本高昂、耗时繁琐,且在需要专业医学知识并涉及多维患者数据的复杂医疗领域难以实现可扩展性。本文引入自适应精确布尔评估准则 (Adaptive Precise Boolean rubrics):一种简化人类与自动化对开放性问题评估的框架,通过识别模型响应中的缺口,利用最小化的针对性问题集实现评估。该方法基于近期在更通用评估情境下的研究,将较小的复杂评估目标与更大量的精确、细粒度目标(可通过简单布尔响应回答)进行对比。我们在包含糖尿病、心血管疾病和肥胖的代谢健康领域验证了该方法。结果表明,自适应精确布尔准则在专家与非专家人类评估者以及自动化评估中,相较传统 Likert 量表法,实现了更高的评估一致性,同时约需一半的评估时间。这种在自动化评估和非专家贡献方面的提升,为在健康领域对 LLMs 进行更广泛且成本效益更高的评估铺平了道路。
引用
@article{arxiv.2503.23339,
title = {A Scalable Framework for Evaluating Health Language Models},
author = {Neil Mallinar and A. Ali Heydari and Xin Liu and Anthony Z. Faranesh and Brent Winslow and Nova Hammerquist and Benjamin Graef and Cathy Speed and Mark Malhotra and Shwetak Patel and Javier L. Prieto and Daniel McDuff and Ahmed A. Metwally},
journal= {arXiv preprint arXiv:2503.23339},
year = {2026}
}