中文

LoC-Path:面向病理多模态大语言模型的学习压缩方法

计算机视觉与模式识别 2026-03-13 v3

摘要

全切片图像(WSI)多模态大语言模型(MLLM)难以构建和部署,因为十亿像素级别的切片会产生数千个视觉标记,而只有一小部分区域具有诊断相关性。现有的切片级病理MLLM通常结合沉重的切片级编码器与长视觉前缀,使得在有限计算资源下进行端到端切片级开发和部署成本高昂。我们重新审视了这一范式,并证明WSI切片特征在全局和局部尺度上都高度冗余,而任务相关证据是稀疏且依赖于查询的。因此,我们引入了LoC-Path,一个资源高效的切片级MLLM,在融合之前进行压缩。LoC-Path使用稀疏标记合并器(STM)和MAE预训练的重采样器,用紧凑的潜在接口替代昂贵的切片级编码,然后使用标记重要性评分器(TIS)选择最相关的潜在表示,并通过交叉注意力路由适配器(CARA)将它们融合到少量LLM解码器层中。该设计通过避免沉重的切片级编码和长视觉前缀,同时降低了多模态微调成本和推理时延迟/内存。广泛的实验表明,LoC-Path在保持与先前切片级MLLM竞争力的同时,使得在有限计算资源下进行端到端开发和部署更加实际。

关键词

引用

@article{arxiv.2512.05391,
  title  = {LoC-Path: Learning to Compress for Pathology Multimodal Large Language Models},
  author = {Qingqiao Hu and Weimin Lyu and Meilong Xu and Kehan Qi and Xiaoling Hu and Saumya Gupta and Jiawei Zhou and Chao Chen},
  journal= {arXiv preprint arXiv:2512.05391},
  year   = {2026}
}

备注

Code will be released soon