中文

多长才足够?探索长程临床笔记语言建模的最优区间

计算与语言 2022-11-16 v1 人工智能

摘要

大型预训练语言模型(LM)已广泛采用于生物医学和临床领域,带来了许多强大的LM,如bio-lm和BioELECTRA。然而,这些方法的实际临床适用性受到限制,因为预训练LM在处理长达数千词的长文本数据方面存在局限,而这是临床笔记的常见长度。在这项工作中,我们利用Longformer探索此类LM的长程适配,使LM能够捕捉更长的临床笔记上下文。我们在三个n2c2挑战数据集和来自香港医院管理局电子健康记录(EHR)系统的纵向临床数据集上进行实验,以展示该思路的有效性和泛化能力,实现了10%的F1分数提升。基于我们的实验,我们得出结论:捕捉更长的临床笔记区间有利于模型性能,但针对不同目标变量存在不同的最优截断区间。我们的代码可在 https://github.com/HLTCHKUST/long-biomedical-model 获取。

关键词

引用

@article{arxiv.2211.07713,
  title  = {How Long Is Enough? Exploring the Optimal Intervals of Long-Range Clinical Note Language Modeling},
  author = {Samuel Cahyawijaya and Bryan Wilie and Holy Lovenia and Huan Zhong and MingQian Zhong and Yuk-Yu Nancy Ip and Pascale Fung},
  journal= {arXiv preprint arXiv:2211.07713},
  year   = {2022}
}