FLAC:通过动能正则化桥接匹配实现的最大熵强化学习
机器学习
2026-02-16 v1 人工智能
摘要
迭代生成策略,如扩散模型和流匹配,对于连续控制具有更好的表达性,但会使最大熵强化学习复杂化,因为动作对数密度难以直接获取。为此,我们提出场最小能量演员-评论家(FLAC),一个无可能性的框架,通过对速度场的动能进行惩罚来调节策略随机性。我们的关键洞察是将策略优化表述为相对于高熵参考过程(如均匀分布)的广义薛德inger桥(GSB)问题。在此视图下,最大熵原理自然地作为保持接近高熵参考而进行奖励优化,无需显式动作密度。在此框架中,动能作为偏离参考的物理依据代理:最小化路径空间能量可限制诱导终端动作分布的偏差。基于此视图,我们推导了能量正则化的策略迭代方案和一个实用的离策略算法,通过拉格朗日对偶机制自动调节动能。经验上,FLAC在高维基准上相对于强大基线实现了优异或相当的性能,同时避免了显式密度估计。
引用
@article{arxiv.2602.12829,
title = {FLAC: Maximum Entropy RL via Kinetic Energy Regularized Bridge Matching},
author = {Lei Lv and Yunfei Li and Yu Luo and Fuchun Sun and Xiao Ma},
journal= {arXiv preprint arXiv:2602.12829},
year = {2026}
}