基于合成临床笔记构建的可公开共享临床大语言模型
计算与语言
2024-07-30 v4 人工智能
摘要
专为处理患者临床笔记而定制的大语言模型的开发,常因严格隐私法规导致这些笔记的可及性和可用性受限而受阻。为应对这些挑战,我们首先利用从生物医学文献中提取的公开可用病例报告创建大规模合成临床笔记。随后,我们使用这些合成笔记训练我们专门的临床大语言模型 Asclepius。尽管 Asclepius 是在合成数据上训练的,我们通过使用真实临床笔记对其进行评估,来衡量其在真实世界应用中的潜在表现。我们将 Asclepius 与包括 GPT-3.5-turbo 在内的其他若干大语言模型以及其他开源替代模型进行基准测试。为进一步验证我们使用合成笔记的方法,我们还将其与在真实临床笔记上训练的变体进行比较。我们的研究结果令人信服地表明,在构建高性能临床语言模型时,合成临床笔记可作为真实笔记的可行替代。GPT-4 和医学专业人员进行的详细评估支持了此结论。Asclepius 开发中所用的所有资源(包括权重、代码和数据)均公开供未来研究使用。(https://github.com/starmpcc/Asclepius)
引用
@article{arxiv.2309.00237,
title = {Publicly Shareable Clinical Large Language Model Built on Synthetic Clinical Notes},
author = {Sunjun Kweon and Junu Kim and Jiyoun Kim and Sujeong Im and Eunbyeol Cho and Seongsu Bae and Jungwoo Oh and Gyubok Lee and Jong Hak Moon and Seng Chan You and Seungjin Baek and Chang Hoon Han and Yoon Bin Jung and Yohan Jo and Edward Choi},
journal= {arXiv preprint arXiv:2309.00237},
year = {2024}
}
备注
ACL 2024 (Findings)