中文

通过注意力视觉语言对齐实现准确且可扩展的多模态病理检索

计算机视觉与模式识别 2025-10-28 v1 信息检索

摘要

组织病理切片的数字化快速开辟了临床和研究工作流程中计算工具的新可能性。在这些工具中,基于内容的切片检索尤为突出,使病理学家能够识别形态和语义相似的病例,从而支持精确诊断,提高不同观察者之间的一致性,并辅助基于案例的教育。然而,由于整块切片图像(WSI)的巨比例尺以及捕捉微妙语义差异中丰富无关内容的困难,有效检索整块切片图像仍然具有挑战性。为克服这些挑战,我们提出了PathSearch检索框架,将细粒度注意力马赛克表示与全局切片嵌入通过视觉语言对比学习进行统一。该框架在6926对切片-报告对上进行训练,能够捕捉细粒度形态学线索和高层次语义模式,从而实现准确且灵活的检索。该框架支持两种关键功能:(1)基于马赛克的图像到图像检索,确保准确且高效的切片检索;(2)多模态检索,其中文本查询可直接检索相关切片。PathSearch在四个公开病理数据集和三个内部队列上进行了严格评估,涵盖了解剖部位检索、肿瘤亚型划分、肿瘤与非肿瘤区分以及跨不同器官(乳腺、肺、肾、肝、胃)的分层评估。外部结果显示,PathSearch超越了传统图像到图像检索框架。进一步的多中心读者研究进一步表明,PathSearch在真实临床场景中提高了诊断准确性,提升了信心水平,并增强了病理学家之间的观察者一致性。这些结果将PathSearch确立为数字病理学中可扩展且通用的检索解决方案。

关键词

引用

@article{arxiv.2510.23224,
  title  = {Accurate and Scalable Multimodal Pathology Retrieval via Attentive Vision-Language Alignment},
  author = {Hongyi Wang and Zhengjie Zhu and Jiabo Ma and Fang Wang and Yue Shi and Bo Luo and Jili Wang and Qiuyu Cai and Xiuming Zhang and Yen-Wei Chen and Lanfen Lin and Hao Chen},
  journal= {arXiv preprint arXiv:2510.23224},
  year   = {2025}
}