中文

基于概念蒸馏的医学知识本体用于放射学报告检索与标注

机器学习 2025-08-28 v1

摘要

基于放射学报告的检索增强学习最近 emerge 作为提高长尾医学影像任务(如胸部 X 光中罕见疾病检测)性能的有前景的方向。大多数现有方法依赖来自如 CLIP 或 CXR-BERT 等模型的高维文本嵌入,这些嵌入常难以解释、计算昂贵,且不利于结构化医学知识的对齐。我们提出了一种新颖的、基于本体的方法,用于基于统一医学语言系统 (UMLS) 中临床依据概念的放射学报告文本比较。该方法从免费文本报告中提取标准化医学实体,采用基于 RadGraph-XL 和 SapBERT 的增强管道实现此目的。这些实体链接到 UMLS 概念 (CUIs), enabling 对每个报告的透明、可解释的基于集合的表示。随后,我们定义基于修改加权 Tversky 指数(考虑同义词、否定和医学实体之间的层次关系)的任务适应相似度度量。这允许在报告之间进行高效且语义上有意义的相似度比较。我们展示了该方法在 MIMIC-CXR 上进行放射图分类任务中的优越性,尤其在长尾设置下。此外,我们使用该管道为 MIMIC-CXR 生成基于本体的疾病标签,为下游学习任务提供了宝贵的新资源。我们的工作为临床 AI 系统提供了更可解释、更可靠、更具任务特定性的检索策略,尤其在可解释性和领域知识集成至关重要时。我们的代码可在 https://github.com/Felix-012/ontology-concept-distillation 查阅。

关键词

引用

@article{arxiv.2508.19915,
  title  = {Ontology-Based Concept Distillation for Radiology Report Retrieval and Labeling},
  author = {Felix Nützel and Mischa Dombrowski and Bernhard Kainz},
  journal= {arXiv preprint arXiv:2508.19915},
  year   = {2025}
}

备注

10 pages, 3 figures, Preprint (submitted version, de-anonymized). Accepted at MLMI (MICCAI Workshop) 2025. Version of Record to appear in Springer LNCS; This preprint has not undergone peer review or any post-submission improvements or corrections