中文

面向中文胸片报告生成的疾病标注器

机器学习 2024-04-29 v1 人工智能 计算与语言 图像与视频处理

摘要

在医学图像分析领域,中文胸片报告数据集的稀缺阻碍了中文胸片报告生成技术的发展。一方面,中文胸片报告数据集的构建受限于耗时且成本高昂的准确专家疾病标注过程。另一方面,通常使用单一的自然语言生成指标来评估生成报告与真实报告之间的相似度,而生成报告的临床准确性和有效性依赖于准确的疾病标注器(分类器)。为了解决这些问题,本研究提出了一种专为中文胸片报告生成定制的疾病标注器。该标注器采用双 BERT 架构分别处理诊断报告和临床信息,并基于疾病与身体部位之间的隶属关系构建了分层标签学习算法,以增强文本分类性能。利用该疾病标注器,建立了一个包含 51,262 个报告样本的中文胸片报告数据集。最后,在专家标注的中文胸片报告子集上进行了实验和分析,验证了所提出的疾病标注器的有效性。

关键词

引用

@article{arxiv.2404.16852,
  title  = {A Disease Labeler for Chinese Chest X-Ray Report Generation},
  author = {Mengwei Wang and Ruixin Yan and Zeyi Hou and Ning Lang and Xiuzhuang Zhou},
  journal= {arXiv preprint arXiv:2404.16852},
  year   = {2024}
}