语义上下文感知模态融合变换器 (SCOUT):用于概念 grounding 病理报告生成的上下文感知多模态变换器
摘要
whole-slide images (WSIs) 对于计算病理学来说 presents a fundamental 挑战,因为其极端分辨率、多尺度异质性以及需要临床可靠解释的要求。尽管最近的病理基础模型已实现了流畅的报告生成,但它们往往缺乏临床 grounding,无法准确表示病理学家观察到的关键诊断概念及其关系。这一局限性源于在保持可解释性和临床连贯性的同时,将细粒度细胞图案、片级别组织结构和高层诊断概念等异构视觉证据整合的困难。本文提出 SCOUT:语义上下文感知 mOdality fUsion Transformer,一款用于病理报告生成的上下文感知 concept-grounded 多模态框架,使图像表示能够通过全局片信息和显式诊断概念进行渐进式条件化。该方法在统一的学习范式中整合局部组织学图案、整个切片上下文和专家精选语义描述,使视觉特征在编码过程中能够动态细化。通过在文本生成期结合 depth-aware contextual modulation 与自适应多模态融合,该框架在保持临床连贯性报告的同时,保留了跨表示尺度的互补性。我们使用 CONCH1.5 特征,在TCGA-BRCA、MICCAI REG 和 HistAI 上评估了 SCOUT。SCOUT 在所有数据集上均取得最佳 BLEU-1 到 BLEU-4 和 METEOR 分数,除此之外,在TCGA-BRCA 和 MICCAI REG 上还取得了最佳 ROUGE-L 分数。在 TCGA-BRCA 上,它达到 BLEU-1/2/3/4 为 0.436/0.303/0.202/0.156 和 0.204 METEOR;在 REG 2025 上,它实现了 0.865/0.834/0.805/0.780 和 0.568。这些结果支持渐进式上下文条件化以实现概念 grounding 病理报告生成。
引用
@article{arxiv.2605.01144,
title = {Semantic Context-aware mOdality fUsion Transformer (SCOUT): A Context-Aware Multimodal Transformer for Concept-Grounded Pathology Report Generation},
author = {Suryakant Singh and Saarthak Kapse and Joel Saltz and Prateek Prasanna},
journal= {arXiv preprint arXiv:2605.01144},
year = {2026}
}