文本预处理对多模态表示学习与病理报告生成的重要性
计算机视觉与模式识别
2025-06-09 v3
摘要
病理学中的视觉-语言模型能够实现多模态病例检索和自动化报告生成。然而,迄今为止开发的许多模型都是在包含无法从配对的全切片图像中推断出的信息(例如,患者病史)的病理报告上训练的,这可能导致生成的报告中出现幻觉句子。为此,我们研究了从病理报告中选择信息进行视觉-语言建模如何影响多模态表示和生成报告的质量。更具体地说,我们比较了在完整报告上训练的模型与在预处理报告上训练的模型,后者仅包含基于H&E染色切片的描述细胞和组织外观的句子。在实验中,我们基于BLIP-2框架,使用了包含42,433张H&E染色全切片图像和19,636份相应病理报告的皮肤黑色素细胞病变数据集。使用图像到文本和文本到图像检索以及专家病理学家对生成报告的定性评估来评估模型性能。我们的结果表明,文本预处理可防止报告生成中的幻觉。尽管生成报告的质量有所提高,但在完整报告上训练视觉-语言模型显示出更好的跨模态检索性能。
引用
@article{arxiv.2502.19285,
title = {On the Importance of Text Preprocessing for Multimodal Representation Learning and Pathology Report Generation},
author = {Ruben T. Lucassen and Tijn van de Luijtgaarden and Sander P. J. Moonemans and Gerben E. Breimer and Willeke A. M. Blokx and Mitko Veta},
journal= {arXiv preprint arXiv:2502.19285},
year = {2025}
}
备注
11 pages, 1 figure