中文

无模型强化学习中中间人攻击检测的基本极限

系统与控制 2026-04-02 v2 机器学习 系统与控制

摘要

我们考虑信息物理系统(CPS)中基于学习的中间人(MITM)攻击问题,并将我们先前提出的无模型强化学习(RL)的Bellman偏差检测(BDD)框架进行了扩展。我们通过允许奖励函数同时依赖于当前状态和后续状态来细化标准MDP攻击模型,从而捕获由对手转移估计误差引起的奖励变化。我们还推导了使可检测价值偏差最小化的对手最优系统辨识策略。进一步,我们证明智能体保护系统所需的渐近学习时间与对手的学习时间呈线性关系,并且该结果与最优下界匹配。因此,所提出的检测方案在检测效率上是阶最优的。最后,我们将框架扩展到异步和间歇攻击场景,其中可靠的检测得以保持。

关键词

引用

@article{arxiv.2603.27592,
  title  = {Fundamental Limits of Man-in-the-Middle Attack Detection in Model-Free Reinforcement Learning},
  author = {Rishi Rani and Massimo Franceschetti},
  journal= {arXiv preprint arXiv:2603.27592},
  year   = {2026}
}