中文

好奇制胜:通过多智能体上下文校准的好奇驱动探索

机器学习 2026-02-24 v3 机器人学

摘要

在稀疏奖励的复杂多智能体强化学习(MARL)中,自主探索从根本上取决于为智能体提供有效的内在动机。虽然人工好奇心提供了一种强大的自监督信号,但它常常将环境的随机性与有意义的新颖性混淆。此外,现有的好奇心机制表现出均匀的新颖性偏见,将所有意外观察同等对待。然而,编码潜在任务动力学的同伴行为新颖性往往被忽视,导致在去中心化、无通信的MARL设置中探索次优。为此,受人类儿童通过观察同伴自适应校准自身探索行为的启发,我们提出了一种增强多智能体探索的新方法。我们引入了CERMIC,一个原则性框架,使智能体能够通过利用推断的多智能体上下文动态校准其内在好奇心,从而鲁棒地过滤噪声惊喜信号并引导探索。此外,CERMIC生成有理论基础的内在奖励,鼓励智能体探索信息增益高的状态转换。我们在包括VMAS、Meltingpot和SMACv2在内的基准套件上评估了CERMIC。实验结果表明,CERMIC的探索在稀疏奖励环境中显著优于现有最优算法。

关键词

引用

@article{arxiv.2509.20648,
  title  = {Wonder Wins Ways: Curiosity-Driven Exploration through Multi-Agent Contextual Calibration},
  author = {Yiyuan Pan and Zhe Liu and Hesheng Wang},
  journal= {arXiv preprint arXiv:2509.20648},
  year   = {2026}
}