通过马尔可夫博弈中的贝叶斯规则归纳学习和维持共享规范系统
人工智能
2024-02-23 v2
摘要
人类社会的一个普遍特征是采用规则和规范系统以实现合作目标。我们如何构建同样能做到这一点的学习智能体,使其能够灵活地与它们所嵌入的人类机构合作?我们假设,智能体可以通过假设存在一套大多数其他人在追求个人欲望时遵守的共享规范来实现这一点,即使他们不知道这些规范的具体内容。通过假设共享规范,新引入的智能体可以从对遵守和违反的观察中推断出现有群体的规范。此外,即使智能体群体最初对规范是什么存在分歧,它们也能收敛到一套共享规范。这进而使得规范系统具有稳定性:由于智能体可以引导出规范的共同知识,这导致规范被广泛遵守,使新进入者能够快速学习这些规范。我们在马尔可夫博弈的背景下形式化了这一框架,并通过近似贝叶斯规则归纳义务性规范和禁止性规范,在多智能体环境中演示了其运作。使用我们的方法,智能体能够快速学习和维持各种合作机构,包括资源管理规范和对亲社会劳动的补偿,在促进集体福祉的同时仍允许智能体为自己的利益行事。
引用
@article{arxiv.2402.13399,
title = {Learning and Sustaining Shared Normative Systems via Bayesian Rule Induction in Markov Games},
author = {Ninell Oldenburg and Tan Zhi-Xuan},
journal= {arXiv preprint arXiv:2402.13399},
year = {2024}
}
备注
Accepted to the 23rd International Conference on Autonomous Agents and Multi-Agent Systems, 8 pages (excl. references), 6 figures/tables, (Appendix: 7 pages, 6 figures/tables). Code available at: https://github.com/ninell-oldenburg/social-contracts