通过阅读手册的封建强化学习
人工智能
2021-10-14 v1
摘要
阅读以行动是一项普遍但具挑战性的任务,需要从简洁指令中进行推理。然而,以往工作面临底层动作与高层语言描述之间的语义不匹配问题,且需要人为设计的课程才能正常运作。本文中,我们提出一种由管理者智能体与工作者智能体组成的封建强化学习(FRL)模型。管理者智能体是一个多跳计划生成器,处理高层抽象信息并以逆向方式生成一系列子目标。工作者智能体处理底层感知与动作,逐一实现子目标。相比之下,我们的 FRL 模型有效缓解了文本级推理与底层感知动作之间的不匹配;且可泛化至各类环境、指令与手册形式;我们的多跳计划生成器能显著助力需多步文本推理才能解决所指示目标的高难度任务。我们展示了该方法在两项挑战性任务——Read to Fight Monsters(RTFM)与 Messenger——上无需人为设计课程学习即取得有竞争力的性能。
引用
@article{arxiv.2110.06477,
title = {Feudal Reinforcement Learning by Reading Manuals},
author = {Kai Wang and Zhonghao Wang and Mo Yu and Humphrey Shi},
journal= {arXiv preprint arXiv:2110.06477},
year = {2021}
}