基于随机最大原理的边际匹配
最优化与控制
2026-04-13 v1 机器学习
摘要
扩散模型和流模型的奖励微调以及从倾斜或布尔特兰分布中进行采样,都可以表述为随机最优控制(SOC)问题,其中学习最优生成动力学对应于在 SDE 约束下优化控制。本文重新审视并推广了最近提出的边际匹配方法,并通过推导自随机最大原理(SMP)将其置于严格的理论基础之上。我们提出了一种通用的哈特福德尔边际匹配目标,用于具有控制相关漂移和扩散且净运行成本的 SOC 问题,证明其期望值与原始 SOC 目标的第一变分相同。因此,其临界点满足哈特福德尔-雅各布布恩-班恩(HJB) stationarity 条件。在状态和控制独立于扩散的重要实际情况下,我们恢复了先前在边际匹配中引入的简洁边际匹配损失,后者避免了二阶项,且其临界点在 mild uniqueness 假设下与最优控制一致。最后,我们表明,边际匹配可被精确地解释为由 SMP 诱导的连续时间 successive approximations 方法,为随机环境下的经典 SMP 算法提供了可实现的替代方案,这些经典算法因难以处理的鞅项而受到限制。这些结果对随机控制社区也具有独立的兴趣,提供了新的可实现目标和在随机问题中进行 SMP 迭代的可行路径。
引用
@article{arxiv.2604.08580,
title = {Adjoint Matching through the Lens of the Stochastic Maximum Principle in Optimal Control},
author = {Carles Domingo-Enrich and Jiequn Han},
journal= {arXiv preprint arXiv:2604.08580},
year = {2026}
}