基于人类正则化搜索与学习的人机协作
人工智能
2022-10-12 v1 机器学习
多智能体系统
摘要
我们考虑在给定人类行为数据集的情况下,如何在部分可观测的完全合作环境中使 AI 智能体与人类良好协作的问题。受 piKL(一种人类数据正则化搜索方法,在不偏离行为克隆策略太远的前提下改进该策略)启发,我们开发了一种三步算法,在 Hanabi 基准测试中实现了与真实人类的强协作性能。我们首先使用正则化搜索算法和行为克隆来生成一个更好的人类模型,以捕捉不同技能水平。然后,我们将策略正则化思想融入强化学习,训练出针对人类模型的类人最佳响应。最后,我们在测试时在最佳响应策略之上应用正则化搜索,以应对与人类博弈时的分布外挑战。我们在两个大规模人类实验中评估了我们的方法。首先,我们展示了在临时组队中与一组多样化的人类玩家博弈时,我们的方法优于专家。其次,我们通过让专家与两个智能体反复博弈,展示了我们的方法胜过了对行为克隆基线的普通最佳响应。
引用
@article{arxiv.2210.05125,
title = {Human-AI Coordination via Human-Regularized Search and Learning},
author = {Hengyuan Hu and David J Wu and Adam Lerer and Jakob Foerster and Noam Brown},
journal= {arXiv preprint arXiv:2210.05125},
year = {2022}
}