中文

盲逆向游戏论:在熵正则竞争性游戏中解码奖励与理性

机器学习 2026-02-24 v2 计算机科学与博弈论 机器学习

摘要

基于熵正则Quantal Response Equilibrium (QRE)的逆向游戏论方法为竞争性环境提供了可行的方法,但关键假设是代理人的理性参数(温度τ\tau)已知。当τ\tau未知时,一个根本的尺度歧义出现,将τ\tau与奖励参数(θ\theta)耦合,使它们在统计上不可辨识。我们引入Blind-IGT,这是第一个能够从观察行为中联合恢复θ\thetaτ\tau的统计框架。我们分析了这个双线性逆问题,提出一种规范化约束以解析尺度歧义,确立唯一识别的必要充分条件。我们提出了有效的归一化最小二乘 (NLS) 估计器,并证明其实现最优O(N1/2)\mathcal{O}(N^{-1/2})收敛速率,以实现联合参数恢复。当强辨识条件失效时,我们通过置信区间构建提供部分辨识保证。我们将框架扩展到马尔可夫游戏,展示在强经验上实现最优收敛速率,即使在转换动力学未知的情况下也表现出色。

关键词

引用

@article{arxiv.2511.05640,
  title  = {Blind Inverse Game Theory: Jointly Decoding Rewards and Rationality in Entropy-Regularized Competitive Games},
  author = {Hamza Virk and Sandro Amaglobeli and Zuhayr Syed},
  journal= {arXiv preprint arXiv:2511.05640},
  year   = {2026}
}