从稀疏且欠规范奖励中学习泛化
机器学习
2020-06-23 v4 人工智能
计算与语言
机器学习
摘要
我们考虑从稀疏且欠规范奖励中学习的问题,其中智能体接收复杂输入(如自然语言指令)并需要生成复杂响应(如动作序列),同时仅接收二值成败反馈。此类成败奖励常常是欠规范的:它们不区分有目的的成功与偶然的成功。从欠规范奖励中泛化取决于剔除获得偶然成功的伪轨迹,而从稀疏反馈中学习需要有效的探索。我们通过使用 KL 散度的模式覆盖方向收集一组多样化的成功轨迹,随后使用模式寻求 KL 散度训练鲁棒策略来解决探索问题。我们提出元奖励学习(MeRL)来构造一个辅助奖励函数,为学习提供更精细的反馈。辅助奖励函数的参数根据已训练策略的验证性能进行优化。MeRL 方法优于我们基于贝叶斯优化的替代奖励学习技术,并在弱监督语义解析上达到最先进水平(state-of-the-art)。它在 WikiTableQuestions 和 WikiSQL 数据集上分别比先前工作提高 1.2% 和 2.4%。
引用
@article{arxiv.1902.07198,
title = {Learning to Generalize from Sparse and Underspecified Rewards},
author = {Rishabh Agarwal and Chen Liang and Dale Schuurmans and Mohammad Norouzi},
journal= {arXiv preprint arXiv:1902.07198},
year = {2020}
}
备注
ICML 2019