中文

赌博机反馈下的随机结构化预测

计算与语言 2017-04-24 v2 机器学习 机器学习

摘要

在赌博机反馈(bandit feedback)下的随机结构化预测遵循如下学习协议:在一系列迭代的每一步,学习器接收一个输入,预测一个输出结构,并接收以预测结构的任务损失评估形式给出的部分反馈。我们提出该学习场景对结构化预测的凸与非凸目标的应用,并将其作为随机一阶方法进行分析。我们给出了在指数级输出空间上的自然语言处理问题的实验评估,并在开发数据上最优任务性能这一实用准则与最小平方梯度范数这一优化理论准则下,比较了不同目标的收敛速度。在两项准则下,均由赌博机反馈下成对偏好学习的非凸目标取得了最佳结果。

关键词

引用

@article{arxiv.1606.00739,
  title  = {Stochastic Structured Prediction under Bandit Feedback},
  author = {Artem Sokolov and Julia Kreutzer and Christopher Lo and Stefan Riezler},
  journal= {arXiv preprint arXiv:1606.00739},
  year   = {2017}
}

备注

30th Conference on Neural Information Processing Systems (NIPS 2016), Barcelona, Spain