面向基于偏好的快速适应的高效元强化学习
机器学习
2022-11-22 v1 人工智能
摘要
从少量试验中学习新的任务特定技能是人工智能的一个基本挑战。元强化学习(meta-RL)通过学习可迁移的策略来解决该问题,这些策略支持对未知任务的少样本适应。尽管元强化学习近期取得了进展,大多数现有方法需要访问新任务的环境奖励函数以推断任务目标,这在许多实际应用中并不现实。为弥补这一差距,我们在人类在回路强化学习的背景下研究少样本适应问题。我们开发了一种元强化学习算法,可利用基于偏好的反馈实现策略的快速适应。智能体可通过查询人类对行为轨迹的偏好而非使用逐步数值奖励来适应新任务。通过拓展信息论技术,我们的方法能够设计查询序列,以最大化来自人类交互的信息增益,同时容忍非专家人类预言机固有的误差。在实验中,我们在一个多样的元强化学习基准任务上广泛评估了我们的方法——带噪声预言机适应(ANOLE),并在反馈效率与误差容忍度方面均展现出相对于基线算法的显著改进。
引用
@article{arxiv.2211.10861,
title = {Efficient Meta Reinforcement Learning for Preference-based Fast Adaptation},
author = {Zhizhou Ren and Anji Liu and Yitao Liang and Jian Peng and Jianzhu Ma},
journal= {arXiv preprint arXiv:2211.10861},
year = {2022}
}
备注
Thirty-sixth Conference on Neural Information Processing Systems (NeurIPS 2022)