基于远程监督神经语言模型从临床笔记中识别重性抑郁障碍
计算与语言
2021-04-21 v1 人工智能
信息检索
摘要
重性抑郁障碍(MDD)是一种普遍的精神障碍,与全球显著的医疗负担相关。MDD 表型分析有助于早期诊断,并可能在患者管理中具有显著优势。先前研究从结构化电子健康记录(EHR)中提取 MDD 表型,或使用传统机器学习模型结合脑电图(EEG)数据预测 MDD 表型。然而,MDD 表型信息也记录于自由文本 EHR 数据(如临床笔记)中。尽管临床笔记可提供更准确的表型信息,仍须开发自然语言处理(NLP)算法以抽取此类信息。NLP 的最新进展产生了最先进的神经语言模型,如基于 Transformer 的双向编码器表示(BERT)模型,该模型可从无监督文本语料预训练,再在 specific 任务上微调。然而,由于缺乏大规模训练数据集,此类神经语言模型在临床 NLP 任务中未得到充分利用。文献中,研究者利用远程监督范式训练临床文本分类任务的机器学习模型,以缓解标注训练数据缺乏的问题。该范式对神经语言模型是否有效仍未知。本文中,我们提出在远程监督范式下利用神经语言模型从临床笔记中识别 MDD 表型。实验结果表明,所提方法在识别 MDD 表型上有效,且用于临床数据的特定 BERT 模型 Bio-Clinical BERT 相较于传统机器学习模型取得了最佳性能。
引用
@article{arxiv.2104.09644,
title = {Neural Language Models with Distant Supervision to Identify Major Depressive Disorder from Clinical Notes},
author = {Bhavani Singh Agnikula Kshatriya and Nicolas A Nunez and Manuel Gardea- Resendez and Euijung Ryu and Brandon J Coombes and Sunyang Fu and Mark A Frye and Joanna M Biernacka and Yanshan Wang},
journal= {arXiv preprint arXiv:2104.09644},
year = {2021}
}