基于软桥策略的生成式演员-评论家
机器学习
2026-05-12 v1 信息论
math.IT
摘要
扩散和流模型等表达性生成策略在 MaxEnt 在线强化学习中备受青睐,因为它们能够建模多模态和高度非高斯动作分布。然而,训练有效的软生成策略面临两个常常并存的障碍:第一,边际动作密度往往不可得,因此现有方法通常依赖于熵界、启发式代理或近似方法;第二,迭代共享参数采样器导致推理成本增加,并需要对重复的网络评估进行时间反向传播,这增加了内存成本并 destabilizes 策略优化。这些障碍促使我们寻求一种在单次采样 actor 前向传递即可完成动作生成的可解析 MaxEnt 目标的生成策略。为此,我们提出了软生成式演员-评论家(SoftGAC),其演员定义了从固定基 latent 到动作 latent 的随机桥接,位于 pre-tanh 空间中。这种结构化桥接允许我们将 MaxEnt 目标提升为对高熵参考过程的解析可行相对熵目标。在实际的有限步实现中,这种相对熵恰好简化为采样转换控制能量,从而提供原则性的软正则化。此外,我们通过使用小的、特定于步数的桥接转换来保持单次 actor 的轻量级,每个采样动作仅评估一次,而保持与强大演员基准相当的参数预算。广泛的在持续控制基准上的实验表明,SoftGAC 在回报上达到或优于包括扩散和流匹配策略在内的多种强大生成策略基准,同时保持单次 actor 的低延迟水平,并在计算-回报权衡方面取得显著改进。
引用
@article{arxiv.2605.08733,
title = {Generative Actor-Critic with Soft Bridge Policies},
author = {Ke He and Le He and Shunpu Tang and Yafei Wang and Lisheng Fan},
journal= {arXiv preprint arXiv:2605.08733},
year = {2026}
}