通过通用语言模型为非英语医学 NLP 创建标注数据集
计算与语言
2022-09-01 v1 人工智能
机器学习
摘要
获取带有语义标注的文本数据集是一个费力过程,但对自然语言处理(NLP)中的监督训练至关重要。通常,在特定领域语境中为任务开发和应用新 NLP 流水线,往往需要有定制设计的数据集以监督机器学习方式处理 NLP 任务。当以非英语语言处理医学数据时,这暴露出若干相互关联的大小问题,例如缺乏任务匹配的数据集以及任务特定的预训练模型。在我们的工作中,我们建议利用预训练语言模型进行训练数据获取,以检索足够大的数据集来训练针对用例特定任务的更小且更高效的模型。为证明您方法的有效性,我们创建了一个自定义数据集,用于训练德语文本的医学 NER 模型 GPTNERMED,但我们的方法原则上保持语言无关。我们获得的数据集及预训练模型公开于:https://github.com/frankkramer-lab/GPTNERMED
引用
@article{arxiv.2208.14493,
title = {Annotated Dataset Creation through General Purpose Language Models for non-English Medical NLP},
author = {Johann Frei and Frank Kramer},
journal= {arXiv preprint arXiv:2208.14493},
year = {2022}
}