2026年米其林方程式能源策略的部分可观测性对手状态推断:HMM-POMDP框架
摘要
2026年米其林方程式技术规定引入了能源策略的根本变更:在50/50的内燃发动机/电池动力分配下,拥有无限再生和由司机控制的Override Mode,最优能源部署策略不仅取决于司机自身状态,还取决于对手车辆的隐藏状态。这构成了一个部分可观测的随机游戏,无法通过单智能体优化方法求解。我们提出了一套可行的两层推理与决策框架。第一层是一个40状态的隐藏马尔可夫模型(HMM),从六个公开可观测的遥测信号推断每辆 rival 车辆的ERS电量水平(四种模式:H、M、L_harvest、L_derate)、Override Mode状态和轮胎磨损状态的概率分布。第二层是一个深度Q网络(DQN)策略以HMM信念状态为输入,选择能源部署策略。我们正式刻画了“反收获陷阱”(counter-harvest trap),这是一种故意抑制可观测部署信号以诱使对手采取失败攻击的欺骗性策略,表明检测它需要对ERS水平和收获/derate子模式的信念状态进行推断。在合成比赛中,HMM实现了96.8%的ERS水平准确率(随机基准25%),以89.4%的准确率分类L_harvest与L_derate,并以96.3%的召回率检测反收获陷阱条件。赛季前分析表明,赛道依赖性充电可用性(每圈1.0倍至2.2倍)为主要混淆因素;墨尔本是最难的验证环境。Baum-Welch校准于2026赛季的2026年澳大利亚大奖(2026年3月8日)开始。
关键词
引用
@article{arxiv.2603.01290,
title = {Opponent State Inference Under Partial Observability: An HMM-POMDP Framework for 2026 Formula 1 Energy Strategy},
author = {Kalliopi Kleisarchaki},
journal= {arXiv preprint arXiv:2603.01290},
year = {2026}
}
备注
17 pages. v3: editorial corrections and bibliographic updates. Pre-registered theoretical framework; empirical calibration on 2026 race telemetry from Australian Grand Prix (8 March 2026) onwards