面向离轨动力学强化学习的回报增强决策Transformer
机器学习
2026-03-03 v2 人工智能
机器人学
机器学习
摘要
我们研究离线非动力学强化学习(RL),旨在利用来自易于访问的源域的数据,来增强数据有限的目标域中的策略学习。我们的方法以回报条件监督学习(RCSL)为中心,特别关注决策Transformer(DT)类型的框架,该框架可以根据期望的回报引导和完整的轨迹历史来预测动作。先前的工作通过增强源域轨迹中的奖励,使其与目标域中的最优轨迹相匹配,来解决动力学偏移问题。然而,由于(1)RCSL 策略类的独特形式,它明确依赖于回报,以及(2)缺乏最优轨迹分布的直接表示,这种策略不能直接应用于 RCSL。我们为 DT 类型框架提出了回报增强(REAG)方法,其中我们通过将源域中的回报分布与目标域中的回报分布对齐来增强源域中的回报。我们提供了理论分析,证明从 REAG 学到的 RCSL 策略能够达到与没有动力学偏移时相同的次优性水平。我们分别介绍了两种实际实现 REAG 和 REAG。在 D4RL 数据集和各种 DT 类型基线模型上的全面实验表明,我们的方法在非动力学强化学习中持续提升了 DT 类型框架的性能。
引用
@article{arxiv.2410.23450,
title = {Return Augmented Decision Transformer for Off-Dynamics Reinforcement Learning},
author = {Ruhan Wang and Yu Yang and Zhishuai Liu and Dongruo Zhou and Pan Xu},
journal= {arXiv preprint arXiv:2410.23450},
year = {2026}
}
备注
26 pages, 11 tables, 8 figures. Published in Transactions on Machine Learning Research (TMLR)