${\mu}^2$Tokenizer:面向放射学报告生成的可微分多尺度多模态 Tokenizer
机器学习
2025-07-03 v2 计算与语言
图像与视频处理
摘要
自动化放射学报告生成 (RRG) 旨在从临床影像(如计算机断层扫描 (CT) 扫描)生成详细文本报告,以提高诊断准确性和效率,并提供管理建议。RRG 面临两个关键挑战:(1) 在资源受限的情况下从影像数据中提取相关信息的内在复杂性,(2) 难以客观评估模型生成报告与专家编写报告之间的差异。为此,我们提出了 LLM,一种用于 RRG 任务的 ltiscale ltimodal 大型语言模型。作为中间层,新型 Tokenizer 集成了多尺度视觉 Tokenizer 和文本 Tokenizer 的多模态特征,通过直接偏好优化 (DPO) 提升报告生成质量,同时以 GREEN-RedLlama 为指导。在四大型 CT 图像-报告医学数据集上的实验结果表明,我们的方法优于现有方法,凸显了在有限数据上为 RRG 任务优化 LLMs 的潜力。同时,对于提示工程,我们引入了一个五阶段、由 LLM 驱动的管道,将常规 CT 报告转换为配对的视觉-问答三元组和带引用链接的推理叙事,创建了一个可扩展的高质量监督语料库,用于解释性多模态放射学 LLM。所有代码、数据集和模型将在官方仓库中公开。https://github.com/Siyou-Li/u2Tokenizer
引用
@article{arxiv.2507.00316,
title = {${\mu}^2$Tokenizer: Differentiable Multi-Scale Multi-Modal Tokenizer for Radiology Report Generation},
author = {Siyou Li and Pengyao Qin and Huanan Wu and Dong Nie and Arun J. Thirunavukarasu and Juntao Yu and Le Zhang},
journal= {arXiv preprint arXiv:2507.00316},
year = {2025}
}
备注
Accepted by MICCAI 2025