我们是否仍需要临床语言模型?
计算与语言
2023-02-17 v1
摘要
尽管近期大规模语言模型(LLMs)的扩展在诸多 NLP 任务上取得了进展,但这些主要用通用网络文本训练的模型在诸如临床文本等高度专业化、安全关键的领域是否仍是合适的工具,仍不明确。近期结果表明,LLMs 编码了令人惊讶的大量医学知识。这引发了一个关于较小领域专用语言模型效用的重要问题。随着通用领域 LLMs 的成功,是否仍需要专门的临床模型?为探究此问题,我们对 12 个语言模型(参数量从 220M 到 175B 不等)进行了广泛的实证分析,衡量它们在 3 种不同临床任务上的表现,这些任务测试其对电子健康记录进行解析与推理的能力。作为实验的一部分,我们从头在 MIMIC III 和 IV 的临床笔记上训练了 T5-Base 和 T5-Large 模型,以直接研究临床词符的效率。我们表明,相对较小的专用临床模型大幅优于所有上下文学习方法,即使在有限标注数据上微调时也是如此。进一步,我们发现,在临床词符上预训练可实现更小、参数更高效的模型,其表现与在通用文本上训练的更大语言模型相当或更优。我们在 PhysioNet 凭证化健康数据许可和数据使用协议下发布所用代码与模型。
引用
@article{arxiv.2302.08091,
title = {Do We Still Need Clinical Language Models?},
author = {Eric Lehman and Evan Hernandez and Diwakar Mahajan and Jonas Wulff and Micah J. Smith and Zachary Ziegler and Daniel Nadler and Peter Szolovits and Alistair Johnson and Emily Alsentzer},
journal= {arXiv preprint arXiv:2302.08091},
year = {2023}
}