Clinical-Longformer 与 Clinical-BigBird:面向长临床序列的 Transformer 模型
计算与语言
2022-04-18 v3 人工智能
摘要
基于 Transformer 的模型(如 BERT)显著提升了各类自然语言处理任务的性能。融入临床知识的模型 ClinicalBERT 在临床命名实体识别和自然语言推理任务上也取得了最先进的结果。这些 Transformer 的核心局限之一是由于其全自注意力机制带来的巨大内存消耗。为克服该问题,长序列 Transformer 模型(如 Longformer 和 BigBird)以稀疏注意力机制为思路被提出,将内存占用从序列长度的平方级降低到线性级。这些模型将最大输入序列长度从 512 扩展到 4096,增强了长程依赖建模能力,从而在多种任务中取得最优结果。受这些长序列 Transformer 模型成功的启发,我们引入两个领域增强的语言模型,即 Clinical-Longformer 和 Clinical-BigBird,它们从大规模临床语料库预训练得到。我们使用包括命名实体识别、问答和文档分类任务在内的 10 个基线任务评估这两个预训练模型。结果表明,Clinical-Longformer 和 Clinical-BigBird 在所有下游任务中持续且显著优于 ClinicalBERT 以及其他短序列 Transformer。我们的源代码已发布于 [https://github.com/luoyuanlab/Clinical-Longformer],预训练模型可于 [https://huggingface.co/yikuan8/Clinical-Longformer] 公开下载。
引用
@article{arxiv.2201.11838,
title = {Clinical-Longformer and Clinical-BigBird: Transformers for long clinical sequences},
author = {Yikuan Li and Ramsey M. Wehbe and Faraz S. Ahmad and Hanyin Wang and Yuan Luo},
journal= {arXiv preprint arXiv:2201.11838},
year = {2022}
}