IQL-TD-MPC:用于分层模型预测控制的隐式 Q 学习
机器学习
2024-05-17 v1 人工智能
摘要
基于模型的强化学习 (RL) 因其样本效率而展现出巨大潜力,但在处理长时序稀疏奖励任务时仍存在困难,尤其是在智能体从固定数据集中学习的离线设置下。我们假设基于模型的 RL 智能体在这些环境中由于缺乏长期规划能力而表现不佳,而在时间抽象的环境模型中进行规划可以缓解这一问题。在本文中,我们做出了两项关键贡献:1) 我们提出了一种离线基于模型的 RL 算法 IQL-TD-MPC,它利用隐式 Q 学习 (IQL) 扩展了最先进的用于模型预测控制的时序差分学习 (TD-MPC);2) 我们提出在分层设置中将 IQL-TD-MPC 用作 Manager,并以任何现成的离线 RL 算法作为 Worker。更具体地说,我们预训练一个时间抽象的 IQL-TD-MPC Manager,通过规划来预测大致对应于子目标的“意图嵌入”。我们凭经验证明,使用由 IQL-TD-MPC manager 生成的意图嵌入来增强状态表示,可显著提升现成离线 RL 智能体在一些最具挑战性的 D4RL 基准任务上的表现。例如,离线 RL 算法 AWAC、TD3-BC、DT 和 CQL 在 medium 和 large antmaze 任务上的归一化评估得分均为零或接近零,而我们的修改将平均得分提升至 40 以上。
引用
@article{arxiv.2306.00867,
title = {IQL-TD-MPC: Implicit Q-Learning for Hierarchical Model Predictive Control},
author = {Rohan Chitnis and Yingchen Xu and Bobak Hashemi and Lucas Lehnert and Urun Dogan and Zheqing Zhu and Olivier Delalleau},
journal= {arXiv preprint arXiv:2306.00867},
year = {2024}
}