RWESummary: 用于总结现实世界证据研究的大型语言模型选择框架与测试
计算与语言
2025-06-24 v1 人工智能
摘要
大型语言模型(LLMs)已被广泛评估用于一般摘要任务以及医学研究辅助, 但尚未针对总结来自结构化输出的现实世界证据(RWE)研究的任务进行评估. 我们引入RWESummary, 作为MedHELM框架(Bedi, Cui, Fuentes, Unell 等, 2025)的一个提议性补充, 以启用对LLMs进行该任务基准测试. RWESummary包括一个情景和三个覆盖医学研究摘要中所观察到的主要错误类型的评估, 其开发基于Atropos Health的专有数据. 此外, 我们使用RWESummary比较了不同LLMs在内部RWE摘要工具中的性能. 在发表时, 我们发现针对13个不同的RWE研究, Gemini 2.5模型在整体上表现最佳(包括Flash和Pro版本). 我们建议RWESummary作为现实世界证据研究摘要的一种新型且有用的基础模型基准.
引用
@article{arxiv.2506.18819,
title = {RWESummary: A Framework and Test for Choosing Large Language Models to Summarize Real-World Evidence (RWE) Studies},
author = {Arjun Mukerji and Michael L. Jackson and Jason Jones and Neil Sanghavi},
journal= {arXiv preprint arXiv:2506.18819},
year = {2025}
}
备注
24 pages, 2 figures