将临床知识注入语言模型的标记器
计算与语言
2024-06-21 v1 人工智能
摘要
本研究介绍了一种新的知识增强标记化机制K-Tokeniser,用于临床文本处理。技术上,在初始化阶段,K-Tokeniser基于领域概念的语义类型(如药物或疾病)从领域本体(如统一医学语言系统)或与任务相关语料库的训练数据中填充全局token表示。在训练或推理阶段,将利用句子级别的局部化上下文来选择最佳的全局token表示,以实现语义基于标记化。为避免使用新标记器进行预训练,提出了一种嵌入初始化方法,用于生成新token的表示。在三个基于变换器的语言模型上进行了一系列实验,以评估K-Tokeniser在广泛的临床文本分析任务中的表现,包括临床概念和关系抽取、自动化临床编码、临床表型识别以及临床研究文章分类。总体而言,我们的模型在所有任务中均优于其对手。特别是在自动化临床编码任务中,Micro F1得分提升了13%。此外,K-Tokeniser还在促进语言模型更快收敛方面显示出显著能力。具体而言,使用K-Tokeniser,语言模型只需50%的训练数据即可达到基线标记器使用全部训练数据时的最佳性能,自动化编码任务中则不足20%。值得一提的是,这些改进无需预训练过程,使该方法具有普适性。
引用
@article{arxiv.2406.14312,
title = {Infusing clinical knowledge into tokenisers for language models},
author = {Abul Hasan and Jinge Wu and Quang Ngoc Nguyen and Salomé Andres and Imane Guellil and Huayu Zhang and Arlene Casey and Beatrice Alex and Bruce Guthrie and Honghan Wu},
journal= {arXiv preprint arXiv:2406.14312},
year = {2024}
}
备注
18 pages, 6 figures