基于模型的轨迹拼接及其在改进行为克隆中的应用
机器学习
2022-12-09 v1 机器学习
摘要
行为克隆(BC)是一种常用的模仿学习方法,用于从专家示范中推断序贯决策策略。然而,当数据质量并非最优时,所得到的行为策略在部署后表现亦次优。近来,离线强化学习方法激增,有望从次优历史数据中提取高质量策略。一种常见方法是在训练期间进行正则化,鼓励策略评估与/或策略改进中的更新保持接近底层数据。本工作中,我们研究改进现有数据质量的离线方法是否能在不改变 BC 算法的情况下带来改进的行为策略。所提出的数据改进方法——轨迹拼接(TS)——通过“拼接”原始数据中不相连的状态对并生成其连接的新动作来生成新轨迹(状态与动作序列)。按构造,这些新转移根据环境的概率模型高度可信,且能改进状态值函数。我们证明以新轨迹替换旧轨迹的迭代过程能逐步改进底层行为策略。大量实验结果表明,相较于从原始数据提取的 BC 策略,使用 TS 可取得显著性能提升。此外,利用 D4RL 基准测试套件,我们证明将 TS 与两种依赖 BC 的现有离线学习方法(基于模型的离线规划(MBOP)与策略约束(TD3+BC))结合可取得最先进结果。
引用
@article{arxiv.2212.04280,
title = {Model-based trajectory stitching for improved behavioural cloning and its applications},
author = {Charles A. Hepburn and Giovanni Montana},
journal= {arXiv preprint arXiv:2212.04280},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:2211.11603