Mini 专家混合模型:克服多实例学习中的线性层瓶颈
计算机视觉与模式识别
2026-03-24 v1
摘要
多实例学习(MIL)是计算病理学中对巨图全切片图像分类的主导框架。MIL 遵循一序列操作:1)提取 patch 特征,2)应用线性层以获得任务特定的 patch 特征,3)将 patch 汇聚为切片特征以进行分类。尽管已为优化 patch 特征提取和汇聚方法而付出了大量努力,但迄今为止尚未解决第二个问题,即转换通用特征为任务特定特征的关键层。我们假设该层构成了一个被忽视的性能瓶颈,更强的表示可以通过针对每个 patch 表型量身定制的低秩转换来实现,从而与任何现有的 MIL 方法产生协同效应。为此,我们引入 MAMMOTH,一个参数高效的多头专家混合模块,旨在以最小对总参数数量的修改提升任何 MIL 模型的性能。在八种 MIL 方法和 19 种不同的分类任务上,我们发现这种任务特定的转换对性能的影响大于汇聚方法的选择。例如,配备 MAMMOTH 后,即使是简单的方法如最大或平均池化,也能获得更高的平均性能,超越使用标准线性层的任何方法。总体而言,MAMMOTH 在 152 个检查配置中的 130 个配置中均提升了性能,平均提升 3.8%。代码已公开至 https://github.com/mahmoodlab/mammoth。
引用
@article{arxiv.2603.22198,
title = {Mixture of Mini Experts: Overcoming the Linear Layer Bottleneck in Multiple Instance Learning},
author = {Daniel Shao and Joel Runevic and Richard J. Chen and Drew F. K. Williamson and Ahrong Kim and Andrew H. Song and Faisal Mahmood},
journal= {arXiv preprint arXiv:2603.22198},
year = {2026}
}
备注
Published in ICLR 2026 (37 pages, 16 figures)