盲逆向游戏论:在熵正则竞争性游戏中解码奖励与理性
机器学习
2026-02-24 v2 计算机科学与博弈论
机器学习
摘要
基于熵正则Quantal Response Equilibrium (QRE)的逆向游戏论方法为竞争性环境提供了可行的方法,但关键假设是代理人的理性参数(温度)已知。当未知时,一个根本的尺度歧义出现,将与奖励参数()耦合,使它们在统计上不可辨识。我们引入Blind-IGT,这是第一个能够从观察行为中联合恢复和的统计框架。我们分析了这个双线性逆问题,提出一种规范化约束以解析尺度歧义,确立唯一识别的必要充分条件。我们提出了有效的归一化最小二乘 (NLS) 估计器,并证明其实现最优收敛速率,以实现联合参数恢复。当强辨识条件失效时,我们通过置信区间构建提供部分辨识保证。我们将框架扩展到马尔可夫游戏,展示在强经验上实现最优收敛速率,即使在转换动力学未知的情况下也表现出色。
引用
@article{arxiv.2511.05640,
title = {Blind Inverse Game Theory: Jointly Decoding Rewards and Rationality in Entropy-Regularized Competitive Games},
author = {Hamza Virk and Sandro Amaglobeli and Zuhayr Syed},
journal= {arXiv preprint arXiv:2511.05640},
year = {2026}
}