GEM:用于离线强化学习中基于行为归一化的引导期望最大化候选动作选择
机器学习
2026-03-25 v1
摘要
离线强化学习(RL)能够从固定数据集中拟合出强大的价值函数,但可靠的部署仍取决于用于查询这些函数的动作选择接口。当数据集导致动作空间呈分支或多模态时,单一模态策略提取可能会模糊竞争假设,产生受数据支持较弱的“中间”动作,使得决策即使在 critic 强大的情况下也显得脆弱。我们提出GEM(Guided Expectation-Maximization),一个分析框架,使动作选择既具多模态性又可被显式控制。GEM通过基于critic引导、以优势权重的EM风格更新来训练高斯混合模型(GMM)演员,以保留不同组件的同时将概率质量向高价值区域移动,并学习可计算的GMM行为模型以量化支持。在推理期间,GEM执行基于候选人的选择:它生成一组平行候选动作,并通过保守的集成下置信区间(lower-confidence bound)和行为归一化支持进行重新排序,其中行为对数似然在每个状态的候选集内标准化,以实现跨状态和候选预算的稳定、可比的控制。经验上,GEM在D4RL基准测试中表现出竞争力,提供了一个简单推理时预算杠杆(候选数量),可在无需重新训练的情况下以计算成本换取决策质量。
引用
@article{arxiv.2603.23232,
title = {GEM: Guided Expectation-Maximization for Behavior-Normalized Candidate Action Selection in Offline RL},
author = {Haoyu Wang and Jingcheng Wang and Shunyu Wu and Xinwei Xiao},
journal= {arXiv preprint arXiv:2603.23232},
year = {2026}
}