LongHealth:一个面向长篇幅临床文档的问答基准
计算与语言
2024-01-29 v1
摘要
背景:大型语言模型(LLMs)的最新进展为医疗保健领域带来了潜在益处,尤其是在处理大量患者记录方面。然而,现有基准并未充分评估LLMs处理真实世界长篇临床数据的能力。方法:我们提出了LongHealth基准,包含20个涵盖不同疾病的详细虚构患者病例,每个病例包含5,090至6,754个单词。该基准通过400道选择题,涵盖信息提取、否定和排序三个类别,挑战LLMs从大型临床文档中提取和解读信息的能力。结果:我们评估了九个上下文长度至少为16,000个token的开源LLMs,并纳入了OpenAI专有且具成本效益的GPT-3.5 Turbo进行比较。Mixtral-8x7B-Instruct-v0.1在专注于从单个和多个患者文档中检索信息的任务上取得了最高准确率。然而,所有模型在需要识别缺失信息的任务中均表现不佳,这凸显了临床数据解读中一个亟待改进的关键领域。结论:尽管LLMs在处理长篇幅临床文档方面显示出巨大潜力,但其当前的准确率水平尚不足以支持可靠的临床应用,尤其是在需要识别缺失信息的场景中。LongHealth基准提供了对医疗环境中LLMs更真实的评估,并强调了为安全有效的临床应用而进一步优化模型的必要性。我们已将基准和评估代码公开发布。
引用
@article{arxiv.2401.14490,
title = {LongHealth: A Question Answering Benchmark with Long Clinical Documents},
author = {Lisa Adams and Felix Busch and Tianyu Han and Jean-Baptiste Excoffier and Matthieu Ortala and Alexander Löser and Hugo JWL. Aerts and Jakob Nikolas Kather and Daniel Truhn and Keno Bressem},
journal= {arXiv preprint arXiv:2401.14490},
year = {2024}
}
备注
11 pages, 3 figures, 5 tables