Context-Former:基于潜在条件序列模型的轨迹拼接
机器学习
2024-05-28 v3 人工智能
摘要
离线强化学习(RL)算法可以通过拼接次优轨迹来推导出更优的轨迹,从而学习到比行为策略更好的决策。同时,决策Transformer(DT)将 RL 抽象为序列建模,在离线 RL 基准测试上展示了有竞争力的性能。然而,近期研究表明 DT 缺乏拼接能力,因此,为 DT 开发拼接能力对于进一步提升其性能至关重要。为了赋予 DT 拼接能力,我们将轨迹拼接抽象为专家匹配,并引入我们的方法 ContextFormer,该方法整合了基于上下文信息的模仿学习(IL)和序列建模,通过模拟有限数量专家轨迹的表征来拼接次优轨迹片段。为验证我们的方法,我们从两个角度进行了实验:1)我们在 IL 设定下对 D4RL 基准进行了广泛实验,实验结果表明 ContextFormer 能在多种 IL 设定中取得有竞争力的性能。2)更重要的是,我们使用相同的训练数据集,将 ContextFormer 与多种有竞争力的 DT 变体进行了比较。实验结果揭示了 ContextFormer 的优越性,其性能优于所有其他变体,展示了其卓越的性能。
引用
@article{arxiv.2401.16452,
title = {Context-Former: Stitching via Latent Conditioned Sequence Modeling},
author = {Ziqi Zhang and Jingzehua Xu and Jinxin Liu and Zifeng Zhuang and Donglin Wang and Miao Liu and Shuai Zhang},
journal= {arXiv preprint arXiv:2401.16452},
year = {2024}
}