中文

基于远程监督神经语言模型从临床笔记中识别重性抑郁障碍

计算与语言 2021-04-21 v1 人工智能 信息检索

摘要

重性抑郁障碍(MDD)是一种普遍的精神障碍,与全球显著的医疗负担相关。MDD 表型分析有助于早期诊断,并可能在患者管理中具有显著优势。先前研究从结构化电子健康记录(EHR)中提取 MDD 表型,或使用传统机器学习模型结合脑电图(EEG)数据预测 MDD 表型。然而,MDD 表型信息也记录于自由文本 EHR 数据(如临床笔记)中。尽管临床笔记可提供更准确的表型信息,仍须开发自然语言处理(NLP)算法以抽取此类信息。NLP 的最新进展产生了最先进的神经语言模型,如基于 Transformer 的双向编码器表示(BERT)模型,该模型可从无监督文本语料预训练,再在 specific 任务上微调。然而,由于缺乏大规模训练数据集,此类神经语言模型在临床 NLP 任务中未得到充分利用。文献中,研究者利用远程监督范式训练临床文本分类任务的机器学习模型,以缓解标注训练数据缺乏的问题。该范式对神经语言模型是否有效仍未知。本文中,我们提出在远程监督范式下利用神经语言模型从临床笔记中识别 MDD 表型。实验结果表明,所提方法在识别 MDD 表型上有效,且用于临床数据的特定 BERT 模型 Bio-Clinical BERT 相较于传统机器学习模型取得了最佳性能。

关键词

引用

@article{arxiv.2104.09644,
  title  = {Neural Language Models with Distant Supervision to Identify Major Depressive Disorder from Clinical Notes},
  author = {Bhavani Singh Agnikula Kshatriya and Nicolas A Nunez and Manuel Gardea- Resendez and Euijung Ryu and Brandon J Coombes and Sunyang Fu and Mark A Frye and Joanna M Biernacka and Yanshan Wang},
  journal= {arXiv preprint arXiv:2104.09644},
  year   = {2021}
}