中文

基于无动作轨迹的半监督离线强化学习

机器学习 2023-06-23 v3 人工智能 机器人学

摘要

自然智能体能有效从多个在规模、质量和测量类型上不同的数据源学习。我们在离线强化学习(RL)背景下通过引入一个新的、受实践驱动的半监督设定来研究这种异质性。此处,智能体可访问两组轨迹:标注轨迹在每时间步包含状态、动作与奖励三元组,以及仅含状态与奖励信息的未标注轨迹。针对该设定,我们开发并研究了一个简单的元算法流程:在标注数据上学习逆动力学模型以为未标注数据获取代理标签,随后在任何离线 RL 算法中使用真实与代理标签轨迹。经验上,我们发现这一简单流程极为成功——在若干 D4RL 基准上,即便仅标注 10% 高度次优的轨迹,某些离线 RL 算法也能匹配基于全标注数据集训练的变体性能。为加深理解,我们开展了一项大规模受控经验研究,考察标注与未标注数据集以数据为中心的性质与算法设计选择(如逆动力学、离线 RL 算法的选取)的相互作用,以识别在半监督离线数据集上训练 RL 智能体的一般趋势与最佳实践。

关键词

引用

@article{arxiv.2210.06518,
  title  = {Semi-Supervised Offline Reinforcement Learning with Action-Free Trajectories},
  author = {Qinqing Zheng and Mikael Henaff and Brandon Amos and Aditya Grover},
  journal= {arXiv preprint arXiv:2210.06518},
  year   = {2023}
}

备注

ICML 2023. Code: https://github.com/facebookresearch/ssorl/