中文

基于邻域的池化用于群体级标签分布学习

机器学习 2021-06-22 v2 机器学习

摘要

监督式机器学习通常需要人工标注数据。虽然标注者间的不一致通常被解释为噪声的证据,但群体级标签分布学习(PLDL)将每个数据项的标注集合视为一群人类标注者意见的样本,其中即使不存在噪声,不一致也可能是合理且可预期的。从这一视角看,一个典型的训练集可能包含大量极小规模的样本,每个数据项对应一个,这些样本本身都不足以代表底层群体对该数据项的信念。我们提出了一种算法框架和用于 PLDL 的新统计检验,以考虑采样规模。我们将它们应用于先前提出的在相似数据项间共享标签的方法。我们还提出了新的标签共享方法,称之为基于邻域的池化。

关键词

引用

@article{arxiv.2003.07406,
  title  = {Neighborhood-based Pooling for Population-level Label Distribution Learning},
  author = {Tharindu Cyril Weerasooriya and Tong Liu and Christopher M. Homan},
  journal= {arXiv preprint arXiv:2003.07406},
  year   = {2021}
}