通过来自人类Bandit反馈的反事实学习改进神经语义解析器
计算与语言
2018-12-03 v2 机器学习
机器学习
摘要
来自人类bandit反馈的反事实学习描述了这样一种场景:记录历史系统输出质量的用户反馈,并用于改进目标系统。我们展示了如何将这一学习框架应用于神经语义解析。从机器学习的角度来看,关键挑战在于对估计量进行恰当的重新加权,以避免反事实学习中已知的退化问题,同时仍适用于随机梯度优化。为了与人类用户进行实验,我们设计了一个易于使用的界面来收集人类对语义解析结果(semantic parses)的反馈。我们的工作是首个表明语义解析器可通过基于已记录人类反馈数据的反事实学习得到显著改进的研究。
引用
@article{arxiv.1805.01252,
title = {Improving a Neural Semantic Parser by Counterfactual Learning from Human Bandit Feedback},
author = {Carolin Lawrence and Stefan Riezler},
journal= {arXiv preprint arXiv:1805.01252},
year = {2018}
}
备注
Conference of the Association for Computational Linguistics (ACL), 2018, Melbourne, Australia