中文

DM-Bench:用于糖尿病管理中个性化决策的大语言模型基准测试

机器学习 2025-10-06 v2 人工智能 计算机与社会

摘要

我们提出了 DM-Bench,这是首个用于评估大语言模型(LLM)在糖尿病患者日常生活中面临实际决策任务性能的基准测试。与先前的健康基准测试(通用、面向临床医生或聚焦临床任务如诊断、分流)不同,DM-Bench 构建了一套针对糖尿病、血糖管理、代谢健康及相关领域面向患者的 AI 解决方案原型设计所特有的挑战的全面评估框架。本基准涵盖 7 种不同的任务类别,反映了糖尿病患者提出的广泛现实问题,包括基础血糖解读、教育性查询、行为关联、高级决策和长期规划。为此,我们汇集了来自 15,000 名患者(包括 1 型糖尿病、2 型糖尿病、糖前期/一般健康与健康管理人群)一个月时间序列数据,数据来自连续血糖监测器(CGM)获取的血糖轨迹与指标以及行为日志(如饮食和活动模式)。基于此数据,我们生成了 360,600 个针对 7 种任务的个性化、情境化问题。我们在这些任务上评估了 5 个指标:准确性、可靠性、安全性、清晰性和可操作性。对 8 个近期 LLM 的分析显示,在不同任务和指标之间存在显著差异;没有单个模型在所有维度上均一致优于其他模型。通过建立此基准,旨在推动糖尿病护理中 AI 解决方案的可靠性、安全性、有效性和实际实用性。

关键词

引用

@article{arxiv.2510.00038,
  title  = {DM-Bench: Benchmarking LLMs for Personalized Decision Making in Diabetes Management},
  author = {Maria Ana Cardei and Josephine Lamp and Mark Derdzinski and Karan Bhatia},
  journal= {arXiv preprint arXiv:2510.00038},
  year   = {2025}
}