中文

TocBERT:基于双向变换器的医学文档结构提取

计算与语言 2024-08-30 v1 信息检索 机器学习

摘要

文本分段在自然语言处理(NLP)领域具有至关重要的重要性。在本工作中,我们提出一种新方法,即 TocBERT,用于基于双向变换器进行文本分段。TocBERT 表示为在标题和副标题的语义表示上进行检测的监督解决方案。该任务被建模为命名实体识别(NER)问题。该方案应用于医学文本分段用例,其中对 Bio-ClinicalBERT 模型进行微调以分割 MIMIC-III 数据集的出院概述。TocBERT 的性能在 250 份人工标注的 ground truth 语料库上进行评估。在线性文本分段问题上达到 84.6% 的 F1 分数,在层次化文本分段问题上达到 72.8%。它在区分标题与副标题方面优于仔细设计的基于规则的解决方案。

关键词

引用

@article{arxiv.2406.19526,
  title  = {TocBERT: Medical Document Structure Extraction Using Bidirectional Transformers},
  author = {Majd Saleh and Sarra Baghdadi and Stéphane Paquelet},
  journal= {arXiv preprint arXiv:2406.19526},
  year   = {2024}
}

备注

6 pages, 6 figures