MedMine:考察预训练语言模型在药物信息抽取上的表现
计算与语言
2023-08-09 v2 人工智能
机器学习
摘要
从临床与生物医学文本中自动抽取药物信息因其对医疗健康应用的实际影响以及强大语言模型(LMs)的近期发展而成为一个热门话题。然而,全自动抽取模型仍面临一些有待克服的障碍,方能直接部署于临床实践以产生更好影响。这些障碍包括其在不同实体类型与临床事件上表现不均衡。在本工作中,我们通过微调(包括单语模型 Med7 与多语大语言模型(LLM)XLM-RoBERTa)考察当前最先进的预训练语言模型(PLMs)在此类任务上的表现。我们利用来自 n2c2-2018 挑战赛的历史药物信息抽取共享任务数据集比较它们的优势与不足。我们报告从这些微调实验中得到的发现,以期促进未来相关研究来解决这些问题,例如如何组合它们的输出、合并此类模型,或通过集成学习和数据增强来提升其整体准确率。MedMine 是 M3 计划的一部分 \url{https://github.com/HECTA-UoM/M3}。
引用
@article{arxiv.2308.03629,
title = {MedMine: Examining Pre-trained Language Models on Medication Mining},
author = {Haifa Alrdahi and Lifeng Han and Hendrik Šuvalov and Goran Nenadic},
journal= {arXiv preprint arXiv:2308.03629},
year = {2023}
}
备注
Open Research Project. 7 pages, 1 figure, 5 tables