MedTri:用于医学报告规范化的平台,增强视觉-语言预训练
计算机视觉与模式识别
2026-02-26 v1
摘要
医学视觉-语言预训练越来越依赖医学报告作为大规模监督信号;然而,原始报告常表现出显著的风格异质性、可变长度以及大量与图像无关的内容。尽管在先前工作中经常采用文本规范化作为预处理步骤,但其设计原则和对视觉-语言预训练的实证影响尚不充分且系统性地得到检讨。在本研究中,我们提出了 MedTri,这是一个可部署的医学视觉-语言预训练规范化框架,将自由文本报告转换为统一的 [解剖实体:放射学描述 + 诊断类别] 三元组。这种结构化、以解剖为基础的规范化保留了关键形态和空间信息,同时消除风格噪声和图像无关内容,为大规模提供一致且以图像为基础的文本监督。我们在跨越 X 射线和 CT 两种模态的多个数据集上演示,结构化、以解剖为基础的文本规范化是医学视觉-语言预训练质量的重要因素,持续地在原始报告和现有规范化基准上实现性能提升。此外,我们说明了这种规范化如何轻松支持模块化文本级数据增强策略,包括知识丰富和以解剖为基础的反事实监督,这些策略在不改变核心规范化过程的情况下提供额外的鲁棒性和泛化能力。总之,我们的结果将结构化文本规范化定位为医学视觉-语言学习的关键且通用的预处理组件,而 MedTri 提供了该规范化平台。代码和数据将在 https://github.com/Arturia-Pendragon-Iris/MedTri 上发布。
引用
@article{arxiv.2602.22143,
title = {MedTri: A Platform for Structured Medical Report Normalization to Enhance Vision-Language Pretraining},
author = {Yuetan Chu and Xinhua Ma and Xinran Jin and Gongning Luo and Xin Gao},
journal= {arXiv preprint arXiv:2602.22143},
year = {2026}
}