多长才足够?探索长程临床笔记语言建模的最优区间
计算与语言
2022-11-16 v1 人工智能
摘要
大型预训练语言模型(LM)已广泛采用于生物医学和临床领域,带来了许多强大的LM,如bio-lm和BioELECTRA。然而,这些方法的实际临床适用性受到限制,因为预训练LM在处理长达数千词的长文本数据方面存在局限,而这是临床笔记的常见长度。在这项工作中,我们利用Longformer探索此类LM的长程适配,使LM能够捕捉更长的临床笔记上下文。我们在三个n2c2挑战数据集和来自香港医院管理局电子健康记录(EHR)系统的纵向临床数据集上进行实验,以展示该思路的有效性和泛化能力,实现了10%的F1分数提升。基于我们的实验,我们得出结论:捕捉更长的临床笔记区间有利于模型性能,但针对不同目标变量存在不同的最优截断区间。我们的代码可在 https://github.com/HLTCHKUST/long-biomedical-model 获取。
引用
@article{arxiv.2211.07713,
title = {How Long Is Enough? Exploring the Optimal Intervals of Long-Range Clinical Note Language Modeling},
author = {Samuel Cahyawijaya and Bryan Wilie and Holy Lovenia and Huan Zhong and MingQian Zhong and Yuk-Yu Nancy Ip and Pascale Fung},
journal= {arXiv preprint arXiv:2211.07713},
year = {2022}
}