中文

MOSAIC:一种面向放射学报告分类的多语言、分类法无关且计算高效的方法

计算与语言 2026-05-19 v2 人工智能

摘要

放射学报告包含丰富的临床信息,可用于训练影像模型而无需依赖昂贵的手动标注。然而,现有方法面临关键局限:基于规则的方法难以处理语言变异性,监督模型需要大型标注数据集,而近期基于 LLM 的系统依赖于不适合临床使用的闭源或资源密集型模型。此外,当前的解决方案主要局限于英语和单模态、单分类法数据集。我们引入了 MOSAIC,一种用于放射学报告分类的多语言、分类法无关且计算高效的方法。MOSAIC 建立在紧凑的开源语言模型(MedGemma-4B)之上,支持零样本/少样本提示和轻量级微调,可在消费级 GPU 上部署。我们在英语、西班牙语、法语和丹麦语的七个数据集上评估了 MOSAIC,涵盖多种影像模态和标签分类法。该模型在五个胸部 X 光片数据集上取得了 88 的平均宏 F1 分数,接近或超过专家级性能,同时仅需 24 GB 的 GPU 内存。通过数据增强,仅需 80 个标注样本就足以在丹麦语报告上达到 82 的加权 F1 分数,而使用完整的 1600 样本训练集则为 86。MOSAIC 为临床环境中的大型或专有 LLM 提供了实用的替代方案。代码和模型均为开源。我们邀请社区在新语言、分类法和模态上评估和扩展 MOSAIC。

关键词

引用

@article{arxiv.2509.04471,
  title  = {MOSAIC: A Multilingual, Taxonomy-Agnostic, and Computationally Efficient Approach for Radiological Report Classification},
  author = {Alice Schiavone and Marco Fraccaro and Lea Marie Pehrson and Silvia Ingala and Rasmus Bonnevie and Michael Bachmann Nielsen and Vincent Beliveau and Melanie Ganz and Desmond Elliott},
  journal= {arXiv preprint arXiv:2509.04471},
  year   = {2026}
}

备注

8 pages, 14 pages including references and appendix. 9 figures. Preprint