中文

通过纳入通用人类专长学习多智能体强化学习中的个体内在奖励

机器学习 2025-07-28 v1 人工智能 多智能体系统

摘要

在仅获得团队奖励的情况下,多智能体强化学习(MARL)中的高效探索是一个具有挑战性的问题,尤其是在奖励稀疏的环境中。通过设计稠密的individual reward 来引导智能体高效探索是缓解此问题的强有力方法之一。然而,individual reward 通常依赖于手动工程的塑造奖励函数,这些函数缺乏高阶智能,因而在复杂问题中学习和泛化效果不如人类。为解决这些问题,我们将上述两种方法结合起来,提出了一种新框架 LIGHT(Learning Individual Intrinsic reward via Incorporating Generalized Human experTise),可以 end-to-end 方式将人类知识整合到 MARL 算法中。LIGHT 通过考虑 individual action distribution 和 human expertise preference distribution,引导每个智能体避免不必要的探索。然后,LIGHT 基于与 Q-learning 相关的可操作表示转换设计 individual intrinsic reward,以便智能体在最大化联合动作价值的同时,将其动作偏好与人类专长一致。实验结果表明,本方法在代表性基线测试中在性能和跨不同稀疏奖励任务的知识可重用性方面均优于现有方法。

关键词

引用

@article{arxiv.2507.18867,
  title  = {Learning Individual Intrinsic Reward in Multi-Agent Reinforcement Learning via Incorporating Generalized Human Expertise},
  author = {Xuefei Wu and Xiao Yin and Yuanyang Zhu and Chunlin Chen},
  journal= {arXiv preprint arXiv:2507.18867},
  year   = {2025}
}

备注

IEEE International Conference on Systems, Man, and Cybernetics