LoC-Path:面向病理多模态大语言模型的学习压缩方法
计算机视觉与模式识别
2026-03-13 v3
摘要
全切片图像(WSI)多模态大语言模型(MLLM)难以构建和部署,因为十亿像素级别的切片会产生数千个视觉标记,而只有一小部分区域具有诊断相关性。现有的切片级病理MLLM通常结合沉重的切片级编码器与长视觉前缀,使得在有限计算资源下进行端到端切片级开发和部署成本高昂。我们重新审视了这一范式,并证明WSI切片特征在全局和局部尺度上都高度冗余,而任务相关证据是稀疏且依赖于查询的。因此,我们引入了LoC-Path,一个资源高效的切片级MLLM,在融合之前进行压缩。LoC-Path使用稀疏标记合并器(STM)和MAE预训练的重采样器,用紧凑的潜在接口替代昂贵的切片级编码,然后使用标记重要性评分器(TIS)选择最相关的潜在表示,并通过交叉注意力路由适配器(CARA)将它们融合到少量LLM解码器层中。该设计通过避免沉重的切片级编码和长视觉前缀,同时降低了多模态微调成本和推理时延迟/内存。广泛的实验表明,LoC-Path在保持与先前切片级MLLM竞争力的同时,使得在有限计算资源下进行端到端开发和部署更加实际。
引用
@article{arxiv.2512.05391,
title = {LoC-Path: Learning to Compress for Pathology Multimodal Large Language Models},
author = {Qingqiao Hu and Weimin Lyu and Meilong Xu and Kehan Qi and Xiaoling Hu and Saumya Gupta and Jiawei Zhou and Chao Chen},
journal= {arXiv preprint arXiv:2512.05391},
year = {2026}
}
备注
Code will be released soon