SoftTiger:一种用于医疗工作流的临床基础模型
计算与语言
2024-08-21 v3 人工智能
摘要
我们介绍了 SoftTiger,这是一种作为医疗工作流基础模型设计的临床大语言模型(CLaM)。临床笔记的叙述性和非结构化性质是医疗智能化的主要障碍。我们解决了一个关键问题,即根据国际互操作性标准将临床笔记结构化为临床数据。我们收集并标注了三个子任务的数据,即国际患者摘要、临床印象和医疗遭遇。随后,我们使用公开和认证的临床数据对最先进的 LLM 进行了监督微调。训练的组织方式使得目标模型首先能够支持缩写扩展和时间信息提取等基本临床任务,然后学习执行更复杂的下游临床任务。此外,我们解决了医疗环境中的若干建模挑战,例如超长上下文窗口。我们的盲测配对评估显示,SoftTiger 优于其他流行的开源模型和 GPT-3.5,与 Gemini-pro 相当,与 GPT-4 仅有微小差距。我们相信 LLM 可能成为迈向医疗数字化和民主化的垫脚石。因此,我们公开发布了参数量为 130 亿和 700 亿的 SoftTiger 模型,以及用于我们创新性可扩展评估的数据集和代码,期望为医疗行业做出重大贡献。
引用
@article{arxiv.2403.00868,
title = {SoftTiger: A Clinical Foundation Model for Healthcare Workflows},
author = {Ye Chen and Igor Couto and Wei Cai and Cong Fu and Bruno Dorneles},
journal= {arXiv preprint arXiv:2403.00868},
year = {2024}
}
备注
Accepted to AAAI 2024 Spring Symposium on Clinical Foundation Models, Stanford University, Stanford, California