DCT:面向大离散动作空间强化学习的动作嵌入双通道训练
机器学习
2023-06-29 v1 人工智能
摘要
在学习鲁棒策略的同时对大离散动作空间进行泛化,是智能系统面临的一个开放性挑战,尤其在面临维度灾难的噪声环境中。本文提出一种新颖框架,用于高效学习动作嵌入,该嵌入同时允许我们重建原始动作并预测期望的未来状态。我们描述了一种带双通道损失的动作嵌入编码器-解码器架构,以平衡动作重建与状态预测精度。我们将训练好的解码器与在标准嵌入空间中产生动作的标准强化学习算法结合使用。我们的架构在两种不同环境中优于两个竞争性基线:一个具有超过 4000 个离散噪声动作的 2D 迷宫环境,以及一个使用真实世界电商交易数据的产品推荐任务。实证结果表明,该模型产生更干净的动作嵌入,且改进的表示有助于学习更好的策略并更早收敛。
引用
@article{arxiv.2306.15913,
title = {DCT: Dual Channel Training of Action Embeddings for Reinforcement Learning with Large Discrete Action Spaces},
author = {Pranavi Pathakota and Hardik Meisheri and Harshad Khadilkar},
journal= {arXiv preprint arXiv:2306.15913},
year = {2023}
}
备注
17 pages