中文

GS-BrainText:来自Generation Scotland的多站点脑影像报告数据集用于临床自然语言处理开发与验证

计算与语言 2026-03-30 v1

摘要

我们提出GS-BrainText,这是一个来自Generation Scotland队列的8,511份脑影像报告精选数据集,其中2,431份标注了24种脑疾病表型。该多站点数据集涵盖五个苏格兰NHS健康板块,包括广泛的年龄代表性(平均年龄58岁,中位年龄53岁),这使其在开发和评估通用临床自然语言处理(NLP)算法和工具方面具有独特价值。由多学科临床团队执行注释,使用注释模式进行注释,每家NHS健康板块进行10-100%的双重注释,并进行严格的质量保证。使用EdIE-R进行基准评估,这是一种现有的基于规则的NLP系统,是与注释模式一起开发的。结果显示该数据集在不同健康板块之间(F1: 86.13-98.13)、表型之间(F1: 22.22-100)和年龄组之间(F1: 87.01-98.13)存在一些性能差异,突显了在NLP工具普遍化方面的关键挑战。GS-BrainText数据集填补了UK临床文本资源中的一个重要空白,为语言变异、诊断不确定性表达以及数据特征对NLP系统性能的影响提供了宝贵资源。

关键词

引用

@article{arxiv.2603.26235,
  title  = {GS-BrainText: A Multi-Site Brain Imaging Report Dataset from Generation Scotland for Clinical Natural Language Processing Development and Validation},
  author = {Beatrice Alex and Claire Grover and Arlene Casey and Richard Tobin and Heather Whalley and William Whiteley},
  journal= {arXiv preprint arXiv:2603.26235},
  year   = {2026}
}

备注

11 pages, 1 figure