ADMEDTAGGER: an annotation framework for distillation of expert knowledge for the Polish medical language
计算与语言
2026-05-19 v2 人工智能
摘要
在这项工作中,我们提出了一个标注框架,展示了如何将在大规模语料库上预训练的多语言 LLM 用作教师模型,以蒸馏出标注波兰语医学文本所需的专家知识。这项工作是名为 ADMEDVOICE 的更大项目的一部分,在该项目中,我们收集了代表五个临床类别——放射学、肿瘤学、心脏病学、高血压和病理学——的广泛医学文本语料库。利用这些数据,我们必须开发一个多类分类器,但根本问题在于缺乏为足够数量的文本进行标注的资源。因此,在我们的解决方案中,我们使用多语言 Llama3.1 模型来标注一个大规模的波兰语医学文本语料库。利用我们有限的标注资源,我们仅验证了这些标签的一部分,并从中创建了一个测试集。以这种方式标注的数据随后被用于训练和验证基于 BERT 架构的 3 种不同类型的分类器——蒸馏后的 DistilBERT 模型、在医学数据上微调的 BioBERT,以及在波兰语语料库上微调的 HerBERT。在我们训练的模型中,DistilBERT 模型取得了最佳结果,每个临床类别的 F1 分数均大于 0.80,其中 3 个类别的 F1 分数大于 0.93。通过这种方式,我们获得了一系列高效分类器,由于其体积缩小近 500 倍、GPU 显存消耗降低 300 倍以及推理速度加快数百倍,它们成为大语言模型的替代方案。
引用
@article{arxiv.2601.09722,
title = {ADMEDTAGGER: an annotation framework for distillation of expert knowledge for the Polish medical language},
author = {Franciszek Górski and Andrzej Czyżewski},
journal= {arXiv preprint arXiv:2601.09722},
year = {2026}
}