中文

面向低资源语言的基于提示学习的克罗恩病放射报告结构化信息抽取

计算与语言 2024-05-24 v2 人工智能

摘要

使用自然语言处理 (NLP) 技术将自由文本放射报告自动转换为结构化数据的功能对于大规模分析疾病至关重要。虽然在广泛使用英文等主流语言中有效,但生成式大语言模型 (LLM) 在较少使用的语言上通常表现不佳,且可能对患者隐私构成风险。针对真实医疗数据集中稀有发现代表了显著数据不平衡的瓶颈,本地化 NLP 模型的微调受到限制。我们引入SMP-BERT,这是一种新颖的提示学习方法,利用报告的结构化特性来克服这些挑战。在针对希伯来语(约8000名患者和10000份报告)的克罗恩病放射报告的研究中,SMP-BERT 在性能上显著优于传统微调方法,尤其在检测稀有疾病方面表现突出(AUC:0.99 vs 0.94,F1:0.84 vs 0.34)。SMP-BERT使更精确的AI诊断工具可用于低资源语言。

关键词

引用

@article{arxiv.2405.01682,
  title  = {Leveraging Prompt-Learning for Structured Information Extraction from Crohn's Disease Radiology Reports in a Low-Resource Language},
  author = {Liam Hazan and Gili Focht and Naama Gavrielov and Roi Reichart and Talar Hagopian and Mary-Louise C. Greer and Ruth Cytter Kuint and Dan Turner and Moti Freiman},
  journal= {arXiv preprint arXiv:2405.01682},
  year   = {2024}
}