相关多实例学习中的泛化差距:基于合成数据的分析
机器学习
2025-11-13 v2
摘要
多实例学习(MIL)常用于医学影像中,通过处理补丁来分类高分辨率2D图像,或通过处理切片来分类3D体积。然而,传统MIL方法将实例单独处理,忽略了诸如相邻补丁或切片的出现,这在实际应用中可能至关重要。我们设计了一个合成分类任务,要求考虑相邻实例特征才能实现准确预测。我们通过量化其性能与该任务的最优贝叶斯估计器(该估计器以闭式形式可用)之间的差距,表明了脱颖而出的MIL方法的局限性。我们经验性地表明,即使是在包含大量实例的每个训练样本中使用10000个训练样本训练,较新的相关MIL方法仍未达到最佳可能性能。
引用
@article{arxiv.2510.25759,
title = {Synthetic Data Reveals Generalization Gaps in Correlated Multiple Instance Learning},
author = {Ethan Harvey and Dennis Johan Loevlie and Michael C. Hughes},
journal= {arXiv preprint arXiv:2510.25759},
year = {2025}
}