Newton's Lantern:用于微调交流功率流热启动模型的强化学习框架
机器学习
2026-05-13 v1 人工智能
系统与控制
系统与控制
摘要
神经热启动可显著减少求解交流功率流问题所需的 Newton-Raphson 迭代次数,但现有的监督方法在接近 voltage collapse 的重负荷实例上泛化性能差。我们证明了 Newton-Raphson 迭代次数的下界仅取决于热启动误差的方向而非其大小,并指出当功率流 Jacobian 最小奇异值缩小时,该下界变得空洞,揭示了监督回归在 saddle-node 分岔处的失效模式。以此为动机,我们引入 Newton's Lantern,一个结合 group relative policy optimization 与基于对 base 模型预测扰动训练的学习奖励模型的微调 pipeline,使用迭代次数本身作为监督信号。跨 IEEE 118 总线、GOC 500 总线和 GOC 2000 总线基准测试,Newton's Lantern 是唯一在每个 test snapshot 上都收敛且达到最小平均迭代次数的方法。
引用
@article{arxiv.2605.11102,
title = {Newton's Lantern: A Reinforcement Learning Framework for Finetuning AC Power Flow Warm Start Models},
author = {Shourya Bose and Helgi Hilmarsson and Dhruv Suri},
journal= {arXiv preprint arXiv:2605.11102},
year = {2026}
}