通过模拟过去学习该做什么
机器学习
2021-05-04 v2 人工智能
机器学习
摘要
由于奖励函数难以指定,近期工作聚焦于从人类反馈中学习策略。然而,此类方法受限于获取反馈的高昂代价。近期工作提出,智能体可获取一种实际上免费的信息源:在任何人类曾施加行动的环境中,状态已然针对人类偏好进行了优化,因而智能体可从状态中提取关于人类需求的信息。这种学习在原理上可行,但要求模拟所有可能导致观测状态的过去轨迹。这在网格世界中可行,但如何将其扩展到复杂任务?在本工作中,我们展示通过结合习得的特征编码器与习得逆模型,可使智能体在时间上向后模拟人类行动以推断其必然所为。所得算法能够在给定从某项技能最优策略中采样出的单一状态下,于 MuJoCo 环境中复现该特定技能。
引用
@article{arxiv.2104.03946,
title = {Learning What To Do by Simulating the Past},
author = {David Lindner and Rohin Shah and Pieter Abbeel and Anca Dragan},
journal= {arXiv preprint arXiv:2104.03946},
year = {2021}
}
备注
Presented at ICLR 2021