中文

基于视觉语言模型与多模态上下文学习的组织病理学图像报告生成

计算机视觉与模式识别 2025-06-24 v1

摘要

从组织病理学图像自动生成医疗报告是一项关键挑战,需要有效的视觉表示和特定领域的知识。受人类专家常见实践的启发,我们提出了一种名为 PathGenIC 的上下文学习框架,该框架将来自训练集的上下文与多模态上下文学习(ICL)机制相集成。我们的方法动态检索语义相似的全切片图像(WSI)-报告对,并结合自适应反馈以增强上下文相关性和生成质量。在 HistGen 基准上进行评估,该框架实现了最先进的结果,在 BLEU、METEOR 和 ROUGE-L 指标上均有显著提升,并在不同报告长度和疾病类别上展现出鲁棒性。通过最大化训练数据效用并以 ICL 桥接视觉与语言,我们的工作为 AI 驱动的组织病理学报告提供了解决方案,为未来多模态临床应用的进展奠定了坚实基础。

关键词

引用

@article{arxiv.2506.17645,
  title  = {Histopathology Image Report Generation by Vision Language Model with Multimodal In-Context Learning},
  author = {Shih-Wen Liu and Hsuan-Yu Fan and Wei-Ta Chu and Fu-En Yang and Yu-Chiang Frank Wang},
  journal= {arXiv preprint arXiv:2506.17645},
  year   = {2025}
}

备注

Accepted to MIDL 2025