基于Transformers的模型推进意大利语生物医学信息抽取:方法学见解与多中心实际应用
计算与语言
2024-01-17 v2 人工智能
机器学习
摘要
医院中计算机化病历的引入减轻了手动书写和信息提取等繁重工作。然而,病历中包含的数据仍远未被充分利用,主要因为从非结构化文本病历中抽取数据耗时费力。信息抽取作为自然语言处理的一个子领域,可通过自动化文本挖掘流水线帮助临床从业者克服这一限制。在本工作中,我们创建了首个意大利语神经精神科命名实体识别数据集PsyNIT,并用其开发了一个基于Transformers的模型。此外,我们收集并利用了三个外部独立数据集来实现一个有效的多中心模型,总体F1分数84.77%、精确率83.16%、召回率86.44%。得到的经验是:(i)一致标注过程的关键作用,以及(ii)将经典方法与“低资源”方法相结合的微调策略。这使我们能够建立方法学指南,为资源较少语言的自然语言处理研究铺平道路。
引用
@article{arxiv.2306.05323,
title = {Advancing Italian Biomedical Information Extraction with Transformers-based Models: Methodological Insights and Multicenter Practical Application},
author = {Claudio Crema and Tommaso Mario Buonocore and Silvia Fostinelli and Enea Parimbelli and Federico Verde and Cira Fundarò and Marina Manera and Matteo Cotta Ramusino and Marco Capelli and Alfredo Costa and Giuliano Binetti and Riccardo Bellazzi and Alberto Redolfi},
journal= {arXiv preprint arXiv:2306.05323},
year = {2024}
}
备注
2 figures, 6 tables, Supplementary Notes included