中文

协商推理:关于可证明解决相对过度泛化

人工智能 2023-06-09 v1 多智能体系统

摘要

过度泛化是认知科学中的棘手问题,人们可能因过往经验变得过度谨慎。多智能体强化学习(MARL)中的智能体也被发现像人一样遭受相对过度泛化(RO),并陷入次优合作。近期方法表明,赋予智能体推理能力可从算法和经验上缓解 RO,但一直缺乏对 RO 的理论理解,更毋论设计可证明无 RO 的方法。本文首先证明当 MARL 方法在特定条件下满足一致推理要求时,可避免 RO。随后我们引入一种称为协商推理的新型推理框架,首次在理论上建立推理与 RO 的联系。之后,我们提出一种实例化算法——Stein 变分协商推理(SVNR),其使用 Stein 变分梯度下降导出在最大熵策略迭代下可证明避免 MARL 中 RO 的协商策略。该方法进一步用神经网络参数化以实现摊销学习,使计算高效。在许多具 RO 挑战的环境中的数值实验证明了 SVNR 相比最先进方法在解决 RO 上的优越性与效率。

关键词

引用

@article{arxiv.2306.05353,
  title  = {Negotiated Reasoning: On Provably Addressing Relative Over-Generalization},
  author = {Junjie Sheng and Wenhao Li and Bo Jin and Hongyuan Zha and Jun Wang and Xiangfeng Wang},
  journal= {arXiv preprint arXiv:2306.05353},
  year   = {2023}
}

备注

21 pages