隐式双塔策略
机器学习
2023-10-26 v2 人工智能
神经与进化计算
摘要
我们提出一类新的结构化强化学习策略架构——隐式双塔(ITT)策略,其中动作是根据其可学习的潜在表示与输入状态的潜在表示之间的注意力分数来选择的。通过在策略栈中显式解耦动作与状态处理,我们实现了两个主要目标:显著的计算收益和更优的性能。我们的架构同时兼容离散和连续动作空间。通过在来自 OpenAI Gym 和 DeepMind Control Suite 的 15 个环境中进行测试,我们表明 ITT 架构特别适用于黑盒/进化优化,且相应的策略训练算法优于其原始的未结构化隐式对应方法以及常用的显式策略。我们通过展示哈希和惰性塔更新等技术如何依赖 ITT 的双塔结构来获得额外的计算改进,补充了我们的分析。
引用
@article{arxiv.2208.01191,
title = {Implicit Two-Tower Policies},
author = {Yunfan Zhao and Qingkai Pan and Krzysztof Choromanski and Deepali Jain and Vikas Sindhwani},
journal= {arXiv preprint arXiv:2208.01191},
year = {2023}
}