中文

基于 Token Compression 的全切片病理图视觉问答高效方法

计算机视觉与模式识别 2025-10-03 v2 计算与语言

摘要

病理全切片图像(Whole-slide images, WSIs)分辨率可达 10,000 x 10,000 像素,由于上下文长度长和计算需求高,对多模态大语言模型(MLLM)构成重大挑战。以往方法通常侧重于切片级分类或基于 CLIP 的 patch 级别分析,采用多实例学习,但缺乏视觉问答(VQA)所需的生成式能力。更近期的 MLLM 方法通过直接将数千个 patch token 输入语言模型来实现 VQA,导致资源消耗过大。为此,我们提出了 Token Compression Pathology LLaVA(TCP-LLaVA),首个实现基于 token compression 的 WSIs VQA 的 MLLM 架构。TCP-LLaVA 引入一组可训练的压缩 token,通过模态压缩模块聚合视觉与文本信息,灵感来源于 BERT 中的 [CLS] token 机制。仅将压缩后的 token 输入 LLM 进行答案生成,显著降低输入长度和计算成本。在十个 TCGA 肿瘤亚型数据集上实验表明,TCP-LLaVA 在 VQA 准确率上优于现有 MLLM 基线方法,同时将训练资源消耗大幅降低。

关键词

引用

@article{arxiv.2507.14497,
  title  = {Efficient Whole Slide Pathology VQA via Token Compression},
  author = {Weimin Lyu and Qingqiao Hu and Kehan Qi and Zhan Shi and Wentao Huang and Saumya Gupta and Chao Chen},
  journal= {arXiv preprint arXiv:2507.14497},
  year   = {2025}
}