中文

技能决策变换器

机器学习 2023-02-01 v1

摘要

近期工作表明,大语言模型(LLMs)通过将传统 RL 问题表示为序列建模问题(Chen et al., 2021; Janner et al., 2021),可极其有效地用于离线强化学习(RL)。然而,这类方法多仅优化高回报,且可能无法从多样化的轨迹数据集中提取太多信息。广义决策变换器(GDTs)(Furuta et al., 2021)已显示,以信息统计形式利用未来轨迹信息,有助于从离线轨迹数据中提取更多信息。在此基础上,我们提出技能决策变换器(Skill DT)。Skill DT 从后见之明重标注(Andrychowicz et al., 2017)与技能发现方法中汲取灵感,以发现一组多样的基元行为,即技能。我们展示 Skill DT 不仅能执行离线状态边缘匹配(SMM),还能发现可轻松采样的具描述性性行为。此外,我们展示通过纯无奖励优化,Skill DT 在 D4RL 基准上仍可与有监督离线 RL 方法相竞争。代码与视频见项目页:https://github.com/shyamsn97/skill-dt

关键词

引用

@article{arxiv.2301.13573,
  title  = {Skill Decision Transformer},
  author = {Shyam Sudhakaran and Sebastian Risi},
  journal= {arXiv preprint arXiv:2301.13573},
  year   = {2023}
}