中文

${\mu}^2$Tokenizer:面向放射学报告生成的可微分多尺度多模态 Tokenizer

机器学习 2025-07-03 v2 计算与语言 图像与视频处理

摘要

自动化放射学报告生成 (RRG) 旨在从临床影像(如计算机断层扫描 (CT) 扫描)生成详细文本报告,以提高诊断准确性和效率,并提供管理建议。RRG 面临两个关键挑战:(1) 在资源受限的情况下从影像数据中提取相关信息的内在复杂性,(2) 难以客观评估模型生成报告与专家编写报告之间的差异。为此,我们提出了 μ2{\mu}^2LLM,一种用于 RRG 任务的 μ{\mu}ltiscale μ{\mu}ltimodal 大型语言模型。作为中间层,新型 μ2{\mu}^2Tokenizer 集成了多尺度视觉 Tokenizer 和文本 Tokenizer 的多模态特征,通过直接偏好优化 (DPO) 提升报告生成质量,同时以 GREEN-RedLlama 为指导。在四大型 CT 图像-报告医学数据集上的实验结果表明,我们的方法优于现有方法,凸显了在有限数据上为 RRG 任务优化 μ2{\mu}^2LLMs 的潜力。同时,对于提示工程,我们引入了一个五阶段、由 LLM 驱动的管道,将常规 CT 报告转换为配对的视觉-问答三元组和带引用链接的推理叙事,创建了一个可扩展的高质量监督语料库,用于解释性多模态放射学 LLM。所有代码、数据集和模型将在官方仓库中公开。https://github.com/Siyou-Li/u2Tokenizer

关键词

引用

@article{arxiv.2507.00316,
  title  = {${\mu}^2$Tokenizer: Differentiable Multi-Scale Multi-Modal Tokenizer for Radiology Report Generation},
  author = {Siyou Li and Pengyao Qin and Huanan Wu and Dong Nie and Arun J. Thirunavukarasu and Juntao Yu and Le Zhang},
  journal= {arXiv preprint arXiv:2507.00316},
  year   = {2025}
}

备注

Accepted by MICCAI 2025