HARP:用于多智能体强化学习的人类辅助重组与排列不变性批评
机器学习
2024-09-19 v1 人工智能
人机交互
多智能体系统
摘要
人类-在-环强化学习将人类专长融入以加速智能体学习并在复杂领域中提供关键指导和反馈。然而,许多现有方法聚焦于单智能体任务,并在训练过程中需要持续的人类参与,这显著增加了人类负担并限制了可扩展性。本文提出了 HARP (人类辅助重组与排列不变性批评),一种为团队导向任务设计的多智能体强化学习框架。HARP 将自动智能体重组与部署中的战略性人类帮助集成在一起,使非专家能够以最小干预提供有效指导。训练期间,智能体会动态调整其组成以优化协作任务完成。部署时,它们会主动寻求人类帮助并利用排列不变性组成批评器来评估和细化人类提议的组成,从而允许非专家用户贡献有价值的建议。在多个协作场景中,我们的方法能够利用来自非专家的有限指导并提升性能。项目可在 https://github.com/huawen-hu/HARP 查找。
引用
@article{arxiv.2409.11741,
title = {HARP: Human-Assisted Regrouping with Permutation Invariant Critic for Multi-Agent Reinforcement Learning},
author = {Huawen Hu and Enze Shi and Chenxi Yue and Shuocun Yang and Zihao Wu and Yiwei Li and Tianyang Zhong and Tuo Zhang and Tianming Liu and Shu Zhang},
journal= {arXiv preprint arXiv:2409.11741},
year = {2024}
}
备注
7 pages, 6 figures