多训练器交互式强化学习系统
机器学习
2022-10-18 v1
摘要
交互式强化学习可通过人类反馈有效促进智能体训练。然而,此类方法通常要求人类教师知道智能体应采取的正确动作。换言之,若人类教师并非始终可靠,则其无法在训练中持续引导智能体。本文通过引入多个训练器,即多训练器交互式强化学习(MTIRL),提出了一种更有效的交互式强化学习系统,该系统可将多个非完美训练器的二元反馈聚合为更可靠的奖励,用于在奖励稀疏环境中训练智能体。特别地,我们的训练器反馈聚合实验表明,与多数投票、加权投票和贝叶斯方法相比,我们的聚合方法具有最佳精度。最后,我们进行网格世界实验,表明经带审查模型的MTIRL训练的策略比无审查模型时更接近最优策略。
引用
@article{arxiv.2210.08050,
title = {Multi-trainer Interactive Reinforcement Learning System},
author = {Zhaori Guo and Timothy J. Norman and Enrico H. Gerding},
journal= {arXiv preprint arXiv:2210.08050},
year = {2022}
}