中文

用于离线强化学习的 Q 值正则化 Decision ConvFormer

机器学习 2024-09-13 v1 机器人学

摘要

作为一种数据驱动的范式,离线强化学习已被表述为序列建模,其中 Decision Transformer (DT) 展现了卓越的能力。与之前拟合价值函数或计算策略梯度的强化学习方法不同,DT 根据预期回报、过去的状态和动作调整自回归模型,使用因果掩码的 Transformer 输出最优动作。然而,由于单条轨迹内的采样回报与多条轨迹间的最优回报之间存在不一致性,设定一个预期回报来输出最优动作并拼接次优轨迹具有挑战性。与 DT 相比,Decision ConvFormer (DC) 在马尔可夫决策过程中对 RL 轨迹进行建模的背景下更易于理解。我们提出了 Q 值正则化 Decision ConvFormer (QDC),它结合了 DC 对 RL 轨迹的理解,并在训练过程中引入了一个利用动态规划方法最大化动作值的项。这确保了采样动作的预期回报与最优回报相一致。QDC 在 D4RL 基准上取得了优异的性能,在所有测试环境中均优于或接近最优水平。它在轨迹拼接能力方面尤其展现出出色的竞争力。

关键词

引用

@article{arxiv.2409.08062,
  title  = {Q-value Regularized Decision ConvFormer for Offline Reinforcement Learning},
  author = {Teng Yan and Zhendong Ruan and Yaobang Cai and Yu Han and Wenxian Li and Yang Zhang},
  journal= {arXiv preprint arXiv:2409.08062},
  year   = {2024}
}