多智能体强化学习的情景式未来思考机制
机器学习
2024-10-24 v1 人工智能
多智能体系统
摘要
理解多智能体相互作用中的认知过程是认知科学的主要目标。这可以引导人工智能(AI)研究的方向,致力于多智能体系统中的社会决策,包括来自异构性不确定性。在本文中,我们引入了一个受动物观察到的认知过程启发的情景式未来思考(EFT)机制,用于强化学习(RL)智能体。为实现未来思考功能,我们首先开发了一个多角色政策,捕获 diverse characters 通过一套异构政策。此处,智能体的角色被定义为奖励组件不同权重组合,表示不同的行为偏好。未来思考智能体收集目标智能体的观察-动作轨迹,并使用预训练的多角色政策推断其角色。一旦推断出角色,智能体便预测目标智能体即将采取的动作,并模拟潜在的未来情景。这种能力使智能体能够考虑预测的未来情景,在多智能体相互作用中自适应地选择最优动作。为评估所提出的机制,我们考虑了具有不同驾驶特征和多个粒子环境的多智能体自动驾驶场景。仿真结果表明,具有准确角色推断的EFT机制优于现有的多智能体解决方案获得更高奖励。我们还确认,奖励改进效应在不同角色多样性水平的社会中依然有效。
引用
@article{arxiv.2410.17373,
title = {Episodic Future Thinking Mechanism for Multi-agent Reinforcement Learning},
author = {Dongsu Lee and Minhae Kwon},
journal= {arXiv preprint arXiv:2410.17373},
year = {2024}
}
备注
NeurIPS 2024 (Web: https://sites.google.com/view/eftm-neurips2024)