DIAR: 基于扩散模型引导的自适应重评价隐式Q学习
机器学习
2024-10-16 v1 人工智能
机器人学
摘要
我们提出一种新颖的离线强化学习方法,引入基于扩散模型引导的自适应重评价隐式Q学习 (DIAR) 框架。我们解决了离线强化学习中的两个关键问题:离分布样本和长期问题。我们利用扩散模型学习状态-动作序列分布,并纳入价值函数以实现更均衡和自适应的决策。DIAR引入了自适应重评价机制,通过比较当前与未来状态的价值来动态调整决策长度,从而实现灵活的长期决策。此外,我们通过将Q网络学习与由扩散模型引导的价值函数相结合,解决了Q值过度估计问题。扩散模型生成多样化的潜在轨迹,增强了策略的鲁棒性和泛化能力。在Maze2D、AntMaze和Kitchen等任务中,DIAR在长期稀疏奖励环境中 consistently 超过了最先进的算法。
引用
@article{arxiv.2410.11338,
title = {DIAR: Diffusion-model-guided Implicit Q-learning with Adaptive Revaluation},
author = {Jaehyun Park and Yunho Kim and Sejin Kim and Byung-Jun Lee and Sundong Kim},
journal= {arXiv preprint arXiv:2410.11338},
year = {2024}
}
备注
Preprint, under review. Comments welcome