中文

拓扑归纳偏置在数据稀缺场景下促进多示例学习

机器学习 2026-03-03 v3 计算机视觉与模式识别 图像与视频处理 定量方法 机器学习

摘要

多示例学习(MIL)是一种弱监督分类框架,其中标签被赋予实例集合(即包)而非单个数据点。该范式在细粒度标注不可用或获取成本高的任务中被证明有效。然而,当训练数据稀缺时(例如罕见疾病分类),MIL 的有效性急剧下降。为应对此挑战,我们提出在 MIL 框架内将拓扑归纳偏置引入数据表示空间。该偏置引入一种拓扑保持约束,鼓励实例编码器在将各包内实例映射到 MIL 潜空间时维持其实例分布的拓扑结构。因此,我们的拓扑引导 MIL(TG-MIL)方法提升了 MIL 分类器在不同聚合函数下的性能与泛化能力,尤其在数据稀缺情形下。我们的评估显示,相较于当前最先进的 MIL 模型,合成 MIL 数据集平均性能提升 15.3%,MIL 基准提升 2.8%,罕见贫血分类提升 5.5%,而每类仅有 17–120 个样本可用。我们公开了代码。

关键词

引用

@article{arxiv.2307.14025,
  title  = {Topological Inductive Bias fosters Multiple Instance Learning in Data-Scarce Scenarios},
  author = {Salome Kazeminia and Carsten Marr and Bastian Rieck},
  journal= {arXiv preprint arXiv:2307.14025},
  year   = {2026}
}