中文

HIGhER:利用事后生成进行经验回放以改进指令跟随

机器学习 2020-12-11 v3 计算与语言 机器学习

摘要

语言创建了世界的紧凑表示,并通过组合性描述无限的情形与目标。尽管这些表征可能有助于指导、调节或结构化交互式智能体行为,即使在简单的指令跟随场景中,如何正确关联语言理解与强化学习仍是一个开放问题。这一联合学习问题可通过专家演示、辅助损失或神经归纳偏置得到缓解。本文提出一种正交方法,称为用于经验回放的事后生成(HIGhER),将事后经验回放(HER)方法扩展至语言条件策略设定。每当智能体未达成其指令时,HIGhER学习输出一条与智能体轨迹相匹配的新指令,并以正奖励重新标记该回合。为此,HIGhER通过学习利用过往成功轨迹将状态映射为指令,从而免去了像原始HER那样需要外部专家干预来重新标记回合。我们在BabyAI环境中展示了方法的效率,并演示了它如何补充其他指令跟随方法。

关键词

引用

@article{arxiv.1910.09451,
  title  = {HIGhER : Improving instruction following with Hindsight Generation for Experience Replay},
  author = {Geoffrey Cideron and Mathieu Seurin and Florian Strub and Olivier Pietquin},
  journal= {arXiv preprint arXiv:1910.09451},
  year   = {2020}
}

备注

Accepted at ADPRL'20