弹性决策变换器
机器学习
2023-10-23 v6 人工智能
摘要
本文提出弹性决策变换器(EDT),是对现有决策变换器(DT)及其变体的重大改进。尽管 DT 声称能生成最优轨迹,经验证据表明其在轨迹拼接上表现不佳——该过程指从一组次优轨迹的最佳部分生成最优或近最优轨迹。所提 EDT 的独到之处在于在测试时动作推断阶段促进轨迹拼接,通过调节 DT 中维持的历史长度实现。进一步,EDT 在先前轨迹最优时保留较长历史、次优时保留较短历史来优化轨迹,使其能与更优轨迹“拼接”。大量实验表明 EDT 能弥合基于 DT 与基于 Q Learning 方法间的性能差距。尤其在 D4RL 运动基准与 Atari 游戏的多任务设定下,EDT 优于基于 Q Learning 的方法。视频见:https://kristery.github.io/edt/
引用
@article{arxiv.2307.02484,
title = {Elastic Decision Transformer},
author = {Yueh-Hua Wu and Xiaolong Wang and Masashi Hamaya},
journal= {arXiv preprint arXiv:2307.02484},
year = {2023}
}
备注
Accepted to NeurIPS 2023