中文

从稀疏且欠规范奖励中学习泛化

机器学习 2020-06-23 v4 人工智能 计算与语言 机器学习

摘要

我们考虑从稀疏且欠规范奖励中学习的问题,其中智能体接收复杂输入(如自然语言指令)并需要生成复杂响应(如动作序列),同时仅接收二值成败反馈。此类成败奖励常常是欠规范的:它们不区分有目的的成功与偶然的成功。从欠规范奖励中泛化取决于剔除获得偶然成功的伪轨迹,而从稀疏反馈中学习需要有效的探索。我们通过使用 KL 散度的模式覆盖方向收集一组多样化的成功轨迹,随后使用模式寻求 KL 散度训练鲁棒策略来解决探索问题。我们提出元奖励学习(MeRL)来构造一个辅助奖励函数,为学习提供更精细的反馈。辅助奖励函数的参数根据已训练策略的验证性能进行优化。MeRL 方法优于我们基于贝叶斯优化的替代奖励学习技术,并在弱监督语义解析上达到最先进水平(state-of-the-art)。它在 WikiTableQuestions 和 WikiSQL 数据集上分别比先前工作提高 1.2% 和 2.4%。

关键词

引用

@article{arxiv.1902.07198,
  title  = {Learning to Generalize from Sparse and Underspecified Rewards},
  author = {Rishabh Agarwal and Chen Liang and Dale Schuurmans and Mohammad Norouzi},
  journal= {arXiv preprint arXiv:1902.07198},
  year   = {2020}
}

备注

ICML 2019