TC-SSA:基于语义插槽聚合的图像标记压缩用于巨图病理推理
计算机视觉与模式识别
2026-03-03 v1 人工智能
摘要
将大型视觉语言模型应用于计算病理学具有巨大的潜力,但面临严峻的计算瓶颈:Whole Slide Images(WSI)的巨比例尺。单个WSI通常包含超过10^5个补丁,导致序列长度超出标准Transformer架构的限制。现有方法常采用空间抽样,风险在于丢弃诊断关键证据。为此,我们提出TC-SSA(Token Compression via Semantic Slot Aggregation,语义插槽聚合的标记压缩),一种可学习的标记压缩框架,将补丁特征聚合到固定数量的语义插槽中。通过稀疏Top-2路由分配补丁到插槽,随后进行加权聚合,在严格的标记预算下实现全局覆盖。 resulting representation 在保留诊断相关信息的同时,将视觉标记数量压缩至原始序列的1.7%。在SlideBench(TCGA)上,我们的模型实现了78.34%的总体准确率和77.14%的诊断子集准确率,优于相当标记预算下的抽样基线。该方法也适用于基于袋装(MIL)分类,在TCGA-BRCA上达95.83%的AUC,在TCGA-NSCLC上达98.27%的AUC,在PANDA上达79.80%的AUC。这些结果表明,可学习的语义聚合为巨图病理推理在效率和诊断性能之间提供了有效的权衡。
引用
@article{arxiv.2603.01143,
title = {TC-SSA: Token Compression via Semantic Slot Aggregation for Gigapixel Pathology Reasoning},
author = {Zhuo Chen and Shawn Young and Lijian Xu},
journal= {arXiv preprint arXiv:2603.01143},
year = {2026}
}
备注
8 pages, 4 figures, 2 tables