堆森伯格博弈中的战略推断:揭示对手意图的最优控制
最优化与控制
2025-10-08 v1
摘要
我们研究了一个连续时间随机Stackelberg博弈,其中领袖希望在推断理性跟随者隐藏参数的同时完成主要目标。跟随者解一个熵正则化的跟踪问题,并以随机化策略响应领袖的轨迹。领袖设计信息性控制以最大化对跟随者潜在意图的估计效率,通过最大似然估计。不同于离散时间或有限候选者的逆学习先前工作,我们的框架实现了连续参数推断,无需先验假设,并通过跟随者的战略反馈内生化信息来源。我们推导了半显式解,证明了问题的良好可解性,并开发了循环神经网络算法来逼近领袖的时变控制。数值实验展示了领袖如何在任务性能与信息获取之间进行平衡,凸显了本方法在对抗性战略推断中的实际价值。
关键词
引用
@article{arxiv.2510.05641,
title = {Strategic Inference in Stackelberg Games: Optimal Control for Revealing Adversary Intent},
author = {Ruimeng Hu and Daniel Ralston and Xu Yang and Haosheng Zhou},
journal= {arXiv preprint arXiv:2510.05641},
year = {2025}
}