GMAT:基于视觉-语言模型用于Whole Slide Image分类的Grounded Multi-Agent临床描述生成
计算机视觉与模式识别
2025-11-19 v2 人工智能
摘要
多实例学习(MIL)是Whole Slide Image(WSI)分类的领先方法,使对Gigapixel尺度病理切片的高效分析成为可能。最近的研究引入了视觉-语言模型(VLM)到MIL流程中,通过基于文本的类描述而非简单类名来融合医学知识。然而,当这些方法依赖大型语言模型(LLM)生成临床描述或使用固定长度的提示来表示复杂病理概念时,VLM的有限token容量往往限制了编码类信息的表达性和丰富性。此外,仅由LLM生成的描述可能缺乏领域对齐和细粒度医学特异性,导致与视觉特征的对齐不optimal。为此,我们提出一种基于VLM-MIL的框架,包含两个关键贡献:(1)一种利用精选病理教科书和智能体专业领域(如形态学、空间背景)生成准确且多样化临床描述的Grounded Multi-Agent描述生成系统;(2)一种使用描述列表而非单一提示的文本编码策略,捕获细粒度和互补临床信号,实现与视觉特征的更好对齐。集成到VLM-MIL管道中,我们的方法在单提示类基准上表现出 improved performance,并在肾癌和肺癌数据集上实现了与最先进模型相当的结果。
引用
@article{arxiv.2508.01293,
title = {GMAT: Grounded Multi-Agent Clinical Description Generation for Text Encoder in Vision-Language MIL for Whole Slide Image Classification},
author = {Ngoc Bui Lam Quang and Nam Le Nguyen Binh and Thanh-Huy Nguyen and Le Thien Phuc Nguyen and Quan Nguyen and Ulas Bagci},
journal= {arXiv preprint arXiv:2508.01293},
year = {2025}
}
备注
Acccepted in MICCAI Workshop 2025