GoldenStart:基于 Q 指导的先验与熵控制用于流政策蒸馏
机器学习
2026-03-17 v1 人工智能
摘要
流匹配政策在强化学习(RL)中具有捕捉复杂多模态动作分布的巨大潜力。然而,其实际应用常受限于高昂的推理延迟和无效的在线探索。虽然近期研究采用单步蒸馏实现快速推理,但初始噪声分布的结构仍是一个被忽视且具有显著未开发潜力的因素。这种被忽视的因素以及控制政策随机性的挑战,构成了推进蒸馏流匹配政策的两个关键领域。为克服这些限制,我们提出 GoldenStart(GSFlow),一种具备 Q 指导先验和显式熵控制的政策蒸馏方法。我们不从无信息噪声初始化生成,而是引入由条件 VAE 模型的 Q 指导先验。该状态条件先验将单步生成过程的起点置于高 Q 区域,有效提供一个“黄金起点”,使政策快速指向有前景的动作。此外,为实现有效的在线探索,我们使蒸馏后的演员能够输出随机分布而非确定性点。通过熵正则化实现对政策随机性的控制,使其能够从纯开发转向原则性探索。我们的集成框架表明,通过设计生成起点并显式控制政策熵,即可实现高效且具探索性的政策,桥接生成模型与实际演员-批评方法。我们在离线和在线连续控制基准上开展了广泛实验,其中我们的方法显著优于先前的最先进方法。代码将在 https://github.com/ZhHe11/GSFlow-RL 上提供。
引用
@article{arxiv.2603.14245,
title = {GoldenStart: Q-Guided Priors and Entropy Control for Distilling Flow Policies},
author = {He Zhang and Ying Sun and Hui Xiong},
journal= {arXiv preprint arXiv:2603.14245},
year = {2026}
}
备注
23 pages, 13 figures