意图之基:利用过往经验的高效逆强化学习
机器学习
2022-08-10 v1
摘要
本文处理逆强化学习 (IRL) 问题——从观测智能体行为推断其奖励函数。IRL 可为学徒学习提供可泛化且紧凑的表示,并能够准确推断人类偏好以对其施以协助。然而,有效的 IRL 具有挑战性,因为许多奖励函数可能与观测到的行为相容。我们聚焦于如何利用先前的强化学习 (RL) 经验使这些偏好的学习更快速、更高效。我们提出 IRL 算法 BASIS (通过样本的后继特征意图推断进行行为获取),其利用多任务 RL 预训练与后继特征,使智能体建立跨越给定领域中可能目标空间的强健意图基。当仅暴露于少量优化新目标的专家演示时,智能体利用其基快速且有效地推断奖励函数。我们的实验表明,我们的方法在推断和优化所演示奖励函数上高度有效,能从少于 100 条轨迹准确推断奖励函数。
引用
@article{arxiv.2208.04919,
title = {Basis for Intentions: Efficient Inverse Reinforcement Learning using Past Experience},
author = {Marwa Abdulhai and Natasha Jaques and Sergey Levine},
journal= {arXiv preprint arXiv:2208.04919},
year = {2022}
}