用于学习网页导航的对抗环境生成
机器学习
2021-03-04 v1 人工智能
多智能体系统
摘要
学习自主导航网页是一项困难的序列决策任务。状态和动作空间本质上庞大且组合化,而网站是由多个页面组成的动态环境。训练网页导航智能体面临的瓶颈之一是提供可学习的训练环境课程,以覆盖现实世界网站的巨大多样性。因此,我们提出使用对抗环境生成(AEG)来生成具有挑战性的网页环境,用以训练强化学习(RL)智能体。我们提供了一个新的基准环境 gMiniWoB,使 RL 对手能够使用组合基元来学习生成任意复杂的网站。为训练该对手,我们提出了一种利用一对导航智能体所得分数之差来最大化后悔值的新技术。我们的结果表明,该方法显著优于先前的最小最大后悔 AEG 方法。后悔目标训练对手设计出对导航智能体“难度恰到好处”的环境课程;我们的结果表明,随着时间推移,对手学会生成日益复杂的网页导航任务。用我们的技术训练的导航智能体学会了完成具有挑战性的高维网页导航任务,例如填表、预订航班等。我们展示,用我们提出的 Flexible b-PAIRED 技术训练的导航智能体,在一组具有挑战性的未见测试环境上显著优于竞争性的自动课程生成基线——包括最先进的 RL 网页导航方法——并在某些任务上达到超过 80% 的成功率。
引用
@article{arxiv.2103.01991,
title = {Adversarial Environment Generation for Learning to Navigate the Web},
author = {Izzeddin Gur and Natasha Jaques and Kevin Malta and Manoj Tiwari and Honglak Lee and Aleksandra Faust},
journal= {arXiv preprint arXiv:2103.01991},
year = {2021}
}
备注
Presented at Deep RL Workshop, NeurIPS, 2020