中文

相关多实例学习中的泛化差距:基于合成数据的分析

机器学习 2025-11-13 v2

摘要

多实例学习(MIL)常用于医学影像中,通过处理补丁来分类高分辨率2D图像,或通过处理切片来分类3D体积。然而,传统MIL方法将实例单独处理,忽略了诸如相邻补丁或切片的出现,这在实际应用中可能至关重要。我们设计了一个合成分类任务,要求考虑相邻实例特征才能实现准确预测。我们通过量化其性能与该任务的最优贝叶斯估计器(该估计器以闭式形式可用)之间的差距,表明了脱颖而出的MIL方法的局限性。我们经验性地表明,即使是在包含大量实例的每个训练样本中使用10000个训练样本训练,较新的相关MIL方法仍未达到最佳可能性能。

关键词

引用

@article{arxiv.2510.25759,
  title  = {Synthetic Data Reveals Generalization Gaps in Correlated Multiple Instance Learning},
  author = {Ethan Harvey and Dennis Johan Loevlie and Michael C. Hughes},
  journal= {arXiv preprint arXiv:2510.25759},
  year   = {2025}
}