中文

在线标签聚合:一种变分贝叶斯方法

机器学习 2020-11-17 v2 机器学习

摘要

带有噪声的标注数据对于众包内容而言与其说是罕见不如说是常态。通过聚合众包工人的结果来提炼噪声并推断正确标签是有效的。为确保时间相关性并克服工人的缓慢响应,在线标签聚合需求日益增长,亟需能够通过数据项子集增量推断真实标签分布的解决方案。本文提出一种新颖的在线标签聚合框架 BiLA,其采用变分贝叶斯推断方法并设计了用于增量训练的随机优化方案。BiLA 可灵活适应任意标签生成分布,通过精确计算其后验分布实现。我们还推导了所提优化器的收敛界。我们在合成与真实世界数据集上,将 BiLA 与基于极小极大熵、神经网络和期望最大化算法的当前最优方法进行比较。我们在多种在线场景下的评估结果表明,BiLA 能有效推断真实标签,在合成和真实世界数据集上错误率分别至少降低 10 和 1.5 个百分点。

关键词

引用

@article{arxiv.1807.07291,
  title  = {Online Label Aggregation: A Variational Bayesian Approach},
  author = {Chi Hong and Amirmasoud Ghiassi and Yichi Zhou and Robert Birke and Lydia Y. Chen},
  journal= {arXiv preprint arXiv:1807.07291},
  year   = {2020}
}