中文

竞争博弈中的奖励解码:基于熵正则化的逆博弈论

机器学习 2026-05-20 v2 机器学习

摘要

估计驱动智能体行为的未知奖励函数是逆强化学习和博弈论的核心问题。为解决此问题,我们开发了一个统一的框架,用于在具有熵正则化的两人零和矩阵博弈和马尔可夫博弈中恢复奖励函数,旨在根据观测到的玩家策略和行动重建潜在的奖励函数。由于逆问题固有的模糊性、可行奖励的非唯一性以及有限的观测数据覆盖范围,这项任务具有挑战性。为应对这些挑战,我们在线性假设下利用量化响应均衡(QRE)建立了奖励函数的可辨识性。在此理论基础之上,我们提出了一种从观测行动中学习奖励函数的新算法。该算法适用于静态和动态环境,并可适配不同的方法,例如最大似然估计(MLE)。我们为算法的可靠性和样本效率提供了强有力的理论保证。此外,我们进行了广泛的数值研究,以证明所提框架的实际有效性,为竞争环境中的决策提供了新的见解。

关键词

引用

@article{arxiv.2601.12707,
  title  = {Decoding Rewards in Competitive Games: Inverse Game Theory with Entropy Regularization},
  author = {Junyi Liao and Zihan Zhu and Ethan Fang and Zhuoran Yang and Vahid Tarokh},
  journal= {arXiv preprint arXiv:2601.12707},
  year   = {2026}
}

备注

Extended journal version of ICML 2025 paper. Submitted to Operations Research