中文

不完整标签多示例多标签学习中的主动学习

机器学习 2021-07-28 v2

摘要

在多示例多标签学习中,每个样本(即一个包)由多个示例组成。为了减轻标注复杂度,每个样本关联一组包级标签,而包内的示例保持未标注状态。这种设置对于表示具有多重语义的复杂对象更为方便和自然。与单示例标注相比,该方法允许在同等标注成本下标注更大的数据集。然而,对于足够大的数据集,标注所有包的成本可能变得极其高昂。主动学习采用迭代标注与重训练的方法,旨在使用少量标注样本提供合理的分类性能。据我们所知,MIML 设置下主动学习领域的现有工作寥寥无几。这些方法能提供降低标注成本的实用解决方案,但其有效性仍不明确。在本文中,我们提出了一种基于包-类对的新方法,用于 MIML 设置下的主动学习。由于包级标签的部分可用性,我们针对所提出的主动学习方法关注不完整标签 MIML 设置。我们的方法基于具有高效且精确推断的判别式图模型。对于查询过程,我们将主动学习准则调整为新的包-类对选择策略。此外,我们引入了在线随机梯度下降算法,以在每次查询后提供高效的模型更新。在基准数据集上的数值实验说明了所提方法的鲁棒性。

关键词

引用

@article{arxiv.2107.10804,
  title  = {Active Learning in Incomplete Label Multiple Instance Multiple Label Learning},
  author = {Tam Nguyen and Raviv Raich},
  journal= {arXiv preprint arXiv:2107.10804},
  year   = {2021}
}

备注

Machine learning, Multiple instance multiple label learning, Active learning, incomplete label learning