中文

探索深度学习方法来从文本中识别罕见疾病及其临床表现

计算与语言 2021-11-12 v2 机器学习 神经与进化计算

摘要

尽管罕见病具有低患病率特征,但约有 3 亿人受罕见病影响。对这些疾病的早期准确诊断是全科医生的一大挑战,因为他们缺乏足够的知识来识别它们。此外,罕见病通常表现出广泛多样的临床表现,这可能使诊断更加困难。延迟诊断会对患者生活产生负面影响。因此,迫切需要从科学与医学层面增加对罕见病的认知。自然语言处理(NLP)与深度学习可帮助提取罕见病的相关信息,以促进其诊断与治疗。本文探索了若干深度学习技术的使用,如双向长短期记忆(BiLSTM)网络或基于来自 Transformers 的双向编码器表示(BERT)的深度上下文词表示,以在 RareDis 语料库中识别罕见病及其临床表现(体征与症状)。该语料库包含超过 5000 种罕见病与近 6000 种临床表现。基于 BERT 并在生物医学语料库上训练的域特定语言表示 BioBERT 取得了最佳结果。具体而言,该模型对罕见病获得了 85.2% 的 F1 分数,优于所有其他模型。

关键词

引用

@article{arxiv.2109.00343,
  title  = {Exploring deep learning methods for recognizing rare diseases and their clinical manifestations from texts},
  author = {Isabel Segura-Bedmar and David Camino-Perdonas and Sara Guerrero-Aspizua},
  journal= {arXiv preprint arXiv:2109.00343},
  year   = {2021}
}