通过隐意图从被动数据中进行强化学习
机器学习
2023-04-12 v1 人工智能
机器学习
摘要
被动观测数据(如人类视频)丰富且信息密集,却被当前 RL 方法 largely 闲置。或许令人惊讶的是,我们表明被动数据尽管没有奖励或动作标签,仍可用于学习加速下游 RL 的特征。我们的方法通过建模意图从被动数据中学习:衡量当智能体为达成特定任务而行动时未来结果可能性的变化。我们提出一种时序差分学习目标来学习意图,得到一种类似常规 RL 但完全从被动数据学习的算法。在优化该目标时,我们的智能体同时从原始观测数据中学习状态、策略和环境中可能结果的表示。无论在理论上还是经验上,该方案都学到了利于下游任务价值预测的特征,且实验证明了从多种被动数据(包括跨本体视频数据和 YouTube 视频)学习的能力。
引用
@article{arxiv.2304.04782,
title = {Reinforcement Learning from Passive Data via Latent Intentions},
author = {Dibya Ghosh and Chethan Bhateja and Sergey Levine},
journal= {arXiv preprint arXiv:2304.04782},
year = {2023}
}
备注
Accompanying website at https://dibyaghosh.com/icvf/