中文

学习在 Web 上导航

机器学习 2018-12-24 v1 计算与语言 机器学习

摘要

在具有大状态与动作空间以及稀疏奖励的环境中学习,会通过试错阻碍强化学习(RL)智能体的学习。例如,在 Web 上遵循自然语言指令(如预订机票)会导致 RL 设定,其中页面上的输入词汇表和可操作元素数量可能变得非常庞大。尽管近期方法借助人类示范引导探索,提高了在相对简单环境中的成功率,但在可能指令集可达数百万的环境中仍会失败。我们从不同角度处理上述问题,并提出引导式 RL 方法,可为智能体生成无限量的学习经验。我们不是从具有大词汇表的复杂指令中学习,而是将其分解为多个子指令,并安排课程,使智能体逐步处理这些相对容易的子指令中不断增加的子集。此外,当专家示范不可用时,我们提出一种新颖的元学习框架,可生成新的指令遵循任务并更有效地训练智能体。我们在这些较小的合成指令上训练 DQN(深度强化学习智能体),其 Q 值函数由一种新颖的 QWeb 神经网络架构近似。我们在 World of Bits 基准上评估智能体泛化到新指令的能力,该基准包含最多 100 个元素的表单,支持 1400 万条可能指令。QWeb 智能体在不使用任何人类示范的情况下优于基线,在多个困难环境中达到 100% 成功率。

关键词

引用

@article{arxiv.1812.09195,
  title  = {Learning to Navigate the Web},
  author = {Izzeddin Gur and Ulrich Rueckert and Aleksandra Faust and Dilek Hakkani-Tur},
  journal= {arXiv preprint arXiv:1812.09195},
  year   = {2018}
}

备注

International Conference on Learning Representations (ICLR), 2019