中文

ColorGrid:用于目标推断与帮助的多智能体非平稳环境

人工智能 2025-01-22 v1 机器学习

摘要

智能体与人类的交互越来越关注适应其不断变化的偏好,以提高对现实任务的帮助效果。有效的智能体必须学习准确推断人类目标,这些目标往往是隐藏的,以便良好地协作。然而,现有的多智能体强化学习(MARL)环境缺乏必需的属性,无法严格评估这些智能体的学习能力。为此,我们引入ColorGrid,这是一个具有可定制非平稳性、非对称性和奖励结构的新型MARL环境。我们调查了独立型深度近端策略优化(IPPO)算法在ColorGrid中的性能,并通过大量消融实验发现,特别是在代表人类的"领袖"智能体与代表助手的"跟随"智能体之间发生同时非平稳和非对称目标时,ColorGrid难以被IPPO解决。为支持对未来MARL算法进行基准测试,我们在https://github.com/andreyrisukhin/ColorGrid上发布了环境代码、模型检查点和轨迹可视化。

关键词

引用

@article{arxiv.2501.10593,
  title  = {ColorGrid: A Multi-Agent Non-Stationary Environment for Goal Inference and Assistance},
  author = {Andrey Risukhin and Kavel Rao and Ben Caffee and Alan Fan},
  journal= {arXiv preprint arXiv:2501.10593},
  year   = {2025}
}