重新思考多实例学习:通过弱监督自训练开发实例级分类器
计算机视觉与模式识别
2024-08-12 v1
摘要
多实例学习(MIL)问题目前要么从包分类角度、要么从实例分类角度求解,两者均忽略了某些实例中包含的重要信息,导致性能有限。例如,现有方法在学习困难正实例方面常常面临困难。在本文中,我们将MIL形式化为一个半监督实例分类问题,以便充分利用所有有标签和无标签的实例来训练更好的分类器。该形式化的难点在于MIL中所有有标签实例均为负样本,而半监督学习中传统的自训练技术在此场景下倾向于退化为无标签实例生成伪标签。为解决此问题,我们提出了一种弱监督自训练方法,利用正包标签在伪标签上构建全局约束和局部约束,以防止其退化并迫使分类器学习困难正实例。值得注意的是,易正实例在分类过程中远离决策边界,而困难正实例则靠近决策边界。通过迭代优化,伪标签可逐渐逼近真实标签。在两个MNIST合成数据集、五个传统MIL基准数据集和两个组织病理学全切片图像数据集上的广泛实验表明,我们的方法在所有数据集上均取得了新的最先进性能。代码将公开发布。
引用
@article{arxiv.2408.04813,
title = {Rethinking Multiple Instance Learning: Developing an Instance-Level Classifier via Weakly-Supervised Self-Training},
author = {Yingfan Ma and Xiaoyuan Luo and Mingzhi Yuan and Xinrong Chen and Manning Wang},
journal= {arXiv preprint arXiv:2408.04813},
year = {2024}
}