中文

大数据循环中的人-算法交互偏差:一种马尔可夫链迭代学习框架

机器学习 2016-08-30 v1 人机交互

摘要

早期的监督机器学习算法依赖可靠的专家标签来构建预测模型。然而,数据生成的大门近来已向更广泛的用户群体敞开,他们越来越多地参与随意标注、评分、注释等活动。人类在线存在和参与的增加,不仅导致了对算法未经检查的输入的民主化,也导致了普通用户对机器学习算法输出“消费”的广泛民主化。因此,这些算法——其中许多正成为推荐系统和其他信息过滤器的核心构件——开始以前所未有的速率与用户交互。结果是,机器学习算法消费越来越多未经检查的数据,或至少是不符合各种机器学习算法常规假设的数据。这些包括有偏样本、有偏标签、训练集与测试集发散,以及算法、人类、人类消费的信息和算法消费的数据之间的循环交互。然而,在机器学习算法的设计与分析中,人类与算法之间的持续交互很少被考虑。在本文中,我们基于受人类语言演化研究启发的迭代学习框架,提出了一个关于人类与算法相互交互的初步理论模型和分析。我们还定义了人类和算法盲点的概念,并概述了通过两个新概念——解毒剂和反应式学习——来修正迭代偏差的机器学习方法。

关键词

引用

@article{arxiv.1608.07895,
  title  = {Human-Algorithm Interaction Biases in the Big Data Cycle: A Markov Chain Iterated Learning Framework},
  author = {Olfa Nasraoui and Patrick Shafto},
  journal= {arXiv preprint arXiv:1608.07895},
  year   = {2016}
}

备注

This research was supported by National Science Foundation grant NSF-1549981