从仅状态序列中学习非马尔可夫决策
机器学习
2023-10-31 v3 人工智能
摘要
传统的模仿学习假设可以访问演示者的动作,但在自然场景中这些运动信号往往不可观测。此外,这些场景中的序列决策行为可能偏离标准马尔可夫决策过程(MDP)的假设。为应对这些挑战,我们探索基于非马尔可夫决策过程(nMDP)的仅状态序列深度生成建模,其中策略是状态转移生成器潜空间中的基于能量的先验。我们开发最大似然估计以实现基于模型的模仿,这涉及从先验的短程MCMC采样以及用于后验的重要性采样。所学模型实现了将决策作为推断:无模型策略执行等价于先验采样,基于模型的规划等价于从策略初始化的后验采样。我们在具有非马尔可夫约束的典型路径规划任务中展示了所提方法的有效性,并表明所学模型在来自MuJoCo套件的挑战性领域中表现出强劲性能。
引用
@article{arxiv.2306.15156,
title = {Learning non-Markovian Decision-Making from State-only Sequences},
author = {Aoyang Qin and Feng Gao and Qing Li and Song-Chun Zhu and Sirui Xie},
journal= {arXiv preprint arXiv:2306.15156},
year = {2023}
}
备注
Accepted at NeurIPS 2023