中文

高效复用自然语言处理模型用于自由文本电子病历中的表型提及识别:方法学研究

计算与语言 2019-10-25 v3 人工智能

摘要

背景:许多工作致力于使用自动化方法(如自然语言处理(NLP))从自由文本病历中挖掘或提取数据,以构建全面的患者档案从而提供更好的医疗。然而,在新环境中复用 NLP 模型仍然繁琐——需要迭代地在新数据上验证和/或重新训练以达成收敛结果。目的:本工作的目标是最小化在自由文本病历上复用 NLP 模型所需的工作量。方法:我们正式定义并分析了表型提及识别任务中的模型适配问题。我们识别出“重复浪费”和“不平衡浪费”,它们共同阻碍高效的模型复用。我们提出一种基于表型嵌入的方法,在新环境中无需标注数据即可最小化这些浪费来源。结果:我们在一个大型精神健康登记处的数据上进行了实验,以在四个表型提及识别任务中复用 NLP 模型。所提出的方法可为新任务选择最佳模型,识别出多达 76%(重复浪费)即无需验证和模型重训练的表型提及,且性能非常好(93–97% 准确率)。它还能为在新任务中针对新颖语言模式验证和重训练所选模型提供指导,节省约 80%(不平衡浪费)即“盲目”模型适配方法所需的工作量。结论:若能显式化并比较旧环境与新环境的语言模式分布,将预训练 NLP 模型适配新任务可更高效且有效。我们的实验表明,表型提及嵌入方法是为表型提及识别任务建模语言模式的有效途径,且其使用可引导高效的 NLP 模型复用。

关键词

引用

@article{arxiv.1903.03995,
  title  = {Efficiently Reusing Natural Language Processing Models for Phenotype-Mention Identification in Free-text Electronic Medical Records: Methodology Study},
  author = {Honghan Wu and Karen Hodgson and Sue Dyson and Katherine I. Morley and Zina M. Ibrahim and Ehtesham Iqbal and Robert Stewart and Richard JB Dobson and Cathie Sudlow},
  journal= {arXiv preprint arXiv:1903.03995},
  year   = {2019}
}