中文

通过风险规避实现马尔可夫博弈中可计算均衡

计算与语言 2024-10-07 v2

摘要

多主体强化学习的发展面临一个重大障碍:如诺贝尔均衡等期望解概念可能难以计算。为克服这一障碍,我们借鉴行为经济学,表明通过赋予代理人诸如风险规避和有限理性等人类决策特征,一类风险规避型量子响应均衡(RQE)在所有 nn 玩家矩阵和有限时段马尔可夫博弈中变得可计算。特别是,我们表明它们作为经调整后博弈中无后悔学习的终点。关键的是,可计算的 RQE 类与博弈结构无关,仅取决于代理人的风险规避程度和有限理性。为验证该 RQE 解概念的丰富性,我们表明它捕捉了在多个 2 玩家矩阵博弈中受实验经济学研究的玩家行为模式。此外,我们首次分析了在有限时段马尔可夫博弈中计算这些均衡的样本复杂度,并在简单的多主体强化学习基准测试中验证了我们的发现。

关键词

引用

@article{arxiv.2406.14155,
  title  = {Aligning Large Language Models with Diverse Political Viewpoints},
  author = {Dominik Stammbach and Philine Widmer and Eunjung Cho and Caglar Gulcehre and Elliott Ash},
  journal= {arXiv preprint arXiv:2406.14155},
  year   = {2024}
}

备注

accepted at EMNLP 2024 main as a short paper