TocBERT:基于双向变换器的医学文档结构提取
计算与语言
2024-08-30 v1 信息检索
机器学习
摘要
文本分段在自然语言处理(NLP)领域具有至关重要的重要性。在本工作中,我们提出一种新方法,即 TocBERT,用于基于双向变换器进行文本分段。TocBERT 表示为在标题和副标题的语义表示上进行检测的监督解决方案。该任务被建模为命名实体识别(NER)问题。该方案应用于医学文本分段用例,其中对 Bio-ClinicalBERT 模型进行微调以分割 MIMIC-III 数据集的出院概述。TocBERT 的性能在 250 份人工标注的 ground truth 语料库上进行评估。在线性文本分段问题上达到 84.6% 的 F1 分数,在层次化文本分段问题上达到 72.8%。它在区分标题与副标题方面优于仔细设计的基于规则的解决方案。
引用
@article{arxiv.2406.19526,
title = {TocBERT: Medical Document Structure Extraction Using Bidirectional Transformers},
author = {Majd Saleh and Sarra Baghdadi and Stéphane Paquelet},
journal= {arXiv preprint arXiv:2406.19526},
year = {2024}
}
备注
6 pages, 6 figures