中文

决策栈:基于模块化生成模型的灵活强化学习

机器学习 2023-10-31 v2 人工智能

摘要

强化学习提供了一种引人注目的范式,用以推理序贯决策的若干不同方面,例如指定复杂目标、规划未来观测与动作、以及评判其效用。然而,这些能力的组合集成在保持最大表达力的同时允许建模选择上的灵活性以实现高效学习与推断方面,带来了相互竞争的算法挑战。我们提出决策栈(Decision Stacks),一种将目标条件策略智能体分解为3个生成模块的生成式框架。这些模块通过可经教师强制(teacher forcing)并行学习的独立生成模型,模拟观测、奖励与动作的时间演化。我们的框架保证了在设计各别模块时兼顾表达力与灵活性,以应对架构偏置、优化目标与动力学、跨域可迁移性以及推断速度等关键因素。我们的实证结果表明,决策栈在多个MDP与POMDP环境的离线策略优化中有效,优于现有方法并实现灵活的生成式决策。

关键词

引用

@article{arxiv.2306.06253,
  title  = {Decision Stacks: Flexible Reinforcement Learning via Modular Generative Models},
  author = {Siyan Zhao and Aditya Grover},
  journal= {arXiv preprint arXiv:2306.06253},
  year   = {2023}
}

备注

published at NeurIPS 2023, project page: https://siyan-zhao.github.io/decision-stacks/