中文

基于孪生神经网络的临床自然语言处理少样本学习

计算与语言 2022-10-28 v2

摘要

临床自然语言处理(NLP)已成为医疗保健中的一项新兴技术,它利用电子健康记录(EHRs)中的大量自由文本数据来改善患者护理、支持临床决策并促进临床与转化科学研究。近来,深度学习在许多临床 NLP 任务中取得了最先进的性能。然而,训练深度学习模型通常需要大型标注数据集,这些数据集通常不公开可用,且在临床领域构建耗时。使用较小的标注数据集在临床 NLP 中很典型,因此确保深度学习模型表现良好对于模型在真实世界应用中的使用至关重要。一种被广泛采用的方法是微调现有的预训练语言模型(PLMs),但当训练数据集仅含少量标注样本时,这些尝试表现不佳。少样本学习(FSL)近来被研究以解决这个问题。孪生神经网络(SNN)作为 FSL 方法已在计算机视觉中被广泛利用,但在 NLP 中尚未被充分研究。此外,其在临床领域应用的文献很少。在本文中,我们提出两种基于 SNN 的临床 NLP 少样本学习方法,包括预训练 SNN(PT-SNN)和带二阶嵌入的 SNN(SOE-SNN)。我们在两个临床任务上评估所提方法,即临床文本分类和临床命名实体识别。我们测试了三种少样本设置,包括 4-shot、8-shot 和 16-shot 学习。两个临床 NLP 任务均使用三种 PLM 进行基准测试,包括 BERT、BioBERT 和 BioClinicalBERT。实验结果验证了所提基于 SNN 的 FSL 方法在两项 NLP 任务中的有效性。

关键词

引用

@article{arxiv.2208.14923,
  title  = {Few-Shot Learning for Clinical Natural Language Processing Using Siamese Neural Networks},
  author = {David Oniani and Sonish Sivarajkumar and Yanshan Wang},
  journal= {arXiv preprint arXiv:2208.14923},
  year   = {2022}
}