DIP-RL:Minecraft中的演示推断偏好学习
机器学习
2023-07-25 v1 人工智能
人机交互
摘要
在序贯决策机器学习中,算法智能体学习与环境交互,同时接收以奖励信号形式的反馈。然而,在许多非结构化的真实世界场景中,此类奖励信号未知,且人类无法可靠地设计出能正确刻画期望行为的奖励信号。为在此类非结构化、开放环境中完成任务,我们提出演示推断偏好强化学习(DIP-RL),一种以三种不同方式利用人类演示的算法,包括训练自编码器、用演示数据播种强化学习(RL)训练批次,以及推断行为偏好以学习引导 RL 的奖励函数。我们在 Minecraft 的砍树任务中评估了 DIP-RL。结果表明,该方法能引导 RL 智能体学习反映人类偏好的奖励函数,且 DIP-RL 相对基线具有竞争力。DIP-RL 受我们此前在 Minecraft 中结合演示与成对偏好的工作启发,该工作荣获 2022 年 NeurIPS MineRL BASALT 竞赛“Minecraft 中从人类反馈学习”研究奖。DIP-RL 与基线的示例轨迹回放见 https://sites.google.com/view/dip-rl。
引用
@article{arxiv.2307.12158,
title = {DIP-RL: Demonstration-Inferred Preference Learning in Minecraft},
author = {Ellen Novoseller and Vinicius G. Goecks and David Watkins and Josh Miller and Nicholas Waytowich},
journal= {arXiv preprint arXiv:2307.12158},
year = {2023}
}
备注
Paper accepted at The Many Facets of Preference Learning Workshop at the International Conference on Machine Learning (ICML), Honolulu, Hawaii, USA, 2023