中文

Fast Dawid-Skene:一种用于情感分类的快速投票聚合方案

机器学习 2018-09-11 v3 机器学习

摘要

许多现实世界的问题现在可以通过监督式机器学习有效解决。一个主要障碍通常是缺乏足够数量的用于训练的标注数据。一种可能的解决方案是将标注数据的任务分配给众包群体,然后使用聚合方法推断真实标签。一种著名的聚合方法是 Dawid-Skene (DS) 算法,它基于期望最大化 (EM) 原理。我们提出一种新的简单而有效的基于 EM 的算法,可解释为 DS 的“硬”版本,其允许更快的收敛,同时在聚合中保持相似的准确率。我们展示了该算法作为在线、实时情感标注的快速有效技术的用途。我们还证明了我们的算法以线性速率收敛到估计标签。我们在标准数据集上的实验显示,在具有竞争力的准确率表现下,聚合所花费的时间显著加速——相比 Dawid-Skene 最高约 8 倍,相比其他快速 EM 方法约 6 倍。算法实现的代码可在 https://github.com/GoodDeeds/Fast-Dawid-Skene 找到。

关键词

引用

@article{arxiv.1803.02781,
  title  = {Fast Dawid-Skene: A Fast Vote Aggregation Scheme for Sentiment Classification},
  author = {Vaibhav B Sinha and Sukrut Rao and Vineeth N Balasubramanian},
  journal= {arXiv preprint arXiv:1803.02781},
  year   = {2018}
}

备注

8 pages, 5 tables, 1 figure, KDD Workshop on Issues of Sentiment Discovery and Opinion Mining (WISDOM) 2018