中文

使用难度条件生成器训练强化学习智能体与人类

人工智能 2023-12-06 v1 人机交互 机器学习

摘要

我们改编了参数化环境响应模型(PERM),这是一种通过直接建模难度和能力在参数化环境中同时训练强化学习(RL)智能体和人类学习者的方法。受项目反应理论(IRT)启发,PERM将环境难度与个人能力相匹配,创建了基于最近发展区的课程。值得注意的是,PERM无需实时RL更新即可运行,并允许离线训练,确保了其对不同学生的适应性。我们提出了一种利用PERM适应性的两阶段训练过程,并在一项实证研究中展示了其在训练RL智能体和人类方面的有效性。

关键词

引用

@article{arxiv.2312.02309,
  title  = {Training Reinforcement Learning Agents and Humans With Difficulty-Conditioned Generators},
  author = {Sidney Tio and Jimmy Ho and Pradeep Varakantham},
  journal= {arXiv preprint arXiv:2312.02309},
  year   = {2023}
}