基于预训练语言模型和提示学习的低资源语言临床信息抽取
计算与语言
2024-12-18 v2 人工智能
机器学习
摘要
从临床文档中自动抽取医疗信息面临诸多挑战:需要高昂的临床专家成本、模型预测的可解释性受限、计算资源受限以及隐私法规限制。近期在领域适应和提示方法方面的进展显示,利用轻量级掩码语言模型在最小训练数据下取得了有前景的结果,这些方法适合于已建立的可解释性方法。我们首次在低资源环境下系统评估这些方法,通过对德国医生信件进行多类别章节分类。我们进行了广泛的类别级评估,借助Shapley值验证小规模训练数据集的质量,并确保模型预测的可解释性。我们展示了,一个轻量级、领域适应的预训练模型,通过仅使用20个样本的提示,准确率比传统分类模型高出30.5%。我们的结果为在低资源条件下开展临床信息抽取项目提供了过程导向的指导指南。
引用
@article{arxiv.2403.13369,
title = {Clinical information extraction for Low-resource languages with Few-shot learning using Pre-trained language models and Prompting},
author = {Phillip Richter-Pechanski and Philipp Wiesenbach and Dominic M. Schwab and Christina Kiriakou and Nicolas Geis and Christoph Dieterich and Anette Frank},
journal= {arXiv preprint arXiv:2403.13369},
year = {2024}
}
备注
Paper accepted for publication in the journal: Natural Language Engineering (Cambridge Core)