中文

用于预测、表征与控制的掩码轨迹模型

机器学习 2023-05-05 v1 人工智能

摘要

我们引入掩码轨迹模型(MTM)作为序列决策制定的通用抽象。MTM 接收一条轨迹(例如状态-动作序列),并以同一轨迹的随机子集为条件来重建该轨迹。通过高度随机化的掩码模式训练,MTM 学习到通用的网络,只需在推理时选择适当的掩码即可承担不同角色或能力。例如,同一个 MTM 网络可用作前向动力学模型、逆向动力学模型,甚至离线 RL 智能体。通过在多个连续控制任务中的大量实验,我们表明同一个 MTM 网络——即相同权重——可以匹配或超越为上述能力专门训练的网络。此外,我们发现 MTM 学习到的状态表征能显著加速传统 RL 算法的学习速度。最后,在离线 RL 基准中,我们发现尽管 MTM 是一种无显式 RL 组件的通用自监督学习方法,但其仍可与专门的离线 RL 算法相竞争。代码见 https://github.com/facebookresearch/mtm

关键词

引用

@article{arxiv.2305.02968,
  title  = {Masked Trajectory Models for Prediction, Representation, and Control},
  author = {Philipp Wu and Arjun Majumdar and Kevin Stone and Yixin Lin and Igor Mordatch and Pieter Abbeel and Aravind Rajeswaran},
  journal= {arXiv preprint arXiv:2305.02968},
  year   = {2023}
}

备注

Accepted for publication at ICML 2023. Project webpage: https://wuphilipp.github.io/mtm/