中文

统一熵正则化在最优控制中的应用:从软策略到经典目标的迭代软策略与路径积分解法

最优化与控制 2026-05-14 v3 机器学习 机器人学 系统与控制 系统与控制

摘要

本文通过 KL 散度正则化的视角,发展了对几种最优控制形式的统一视角。我们提出一种中心问题,将对策略和转换的 KL 惩罚分别赋予独立权重,从而概括了概率最优控制中常用的轨迹级 KL 正则化。该统一框架恢复了各种控制问题:经典随机最优控制(SOC)、风险敏感型随机最优控制(RSOC)以及它们的基于策略的 KL 正则化变体,称为软策略 SOC 和 RSOC,这些变体产生可计算的近似。除了正则化变体之外,这些软策略形式对原始 SOC 和 RSOC 进行上调,从而,通过迭代其解可以恢复原始目标。我们进一步识别了软策略 RSOC 的一个同步情形,其中策略和转换 KL 权重相同,导致线性 Bellman 算子、路径积分解以及可组合性——将这些计算上可取的性质扩展到广泛的控制问题类。

关键词

引用

@article{arxiv.2512.06109,
  title  = {Unifying Entropy Regularization in Optimal Control: From and Back to Classical Objectives via Iterated Soft Policies and Path Integral Solutions},
  author = {Ajinkya Bhole and Mohammad Mahmoudi Filabadi and Guillaume Crevecoeur and Tom Lefebvre},
  journal= {arXiv preprint arXiv:2512.06109},
  year   = {2026}
}

备注

refurbished introduction, added a few remarks, reduced size