基于柔性注意力机制的多策略融合高效深度强化学习
机器学习
2023-10-11 v2 人工智能
机器人学
摘要
强化学习(RL)智能体长期以来力求接近人类学习的效率。人类是出色的观察者,能够通过聚合来自多种来源的外部知识进行学习,包括他人尝试任务时的策略观察。RL 的先前研究已引入外部知识策略以帮助智能体提升样本效率。然而,对这些策略进行任意组合与替换——这是实现泛化与可迁移性的关键特性——仍然十分困难。在这项工作中,我们提出知识驱动强化学习(KGRL),一种融合多种知识策略、旨在实现类人效率与灵活性的 RL 范式。我们为 KGRL 提出了一种新的 actor 架构,即知识包容注意力网络(KIAN),其基于嵌入的注意力动作预测允许自由的知识重排。KIAN 还通过一种新的策略分布设计,解决了最大熵 KGRL 中出现的熵失衡问题,该问题会阻碍智能体高效探索环境。实验结果表明,KIAN 优于其他融合外部知识策略的方法,并实现了高效且灵活的学习。我们的实现可在 https://github.com/Pascalson/KGRL.git 获取。
引用
@article{arxiv.2210.03729,
title = {Flexible Attention-Based Multi-Policy Fusion for Efficient Deep Reinforcement Learning},
author = {Zih-Yun Chiu and Yi-Lin Tuan and William Yang Wang and Michael C. Yip},
journal= {arXiv preprint arXiv:2210.03729},
year = {2023}
}
备注
NeurIPS 2023