矩匹配Q学习
机器学习
2026-05-29 v1
摘要
基于得分的生成模型和流模型在捕捉复杂分布方面表现突出,已广泛部署于从图像生成到强化学习等诸多任务。然而,这些模型 suffer from 推断延迟较长,这在迭代抽样的RL中造成显著的计算瓶颈。为克服这一限制,我们提出了一种新框架,称为矩匹配Q学习(MoMa QL),其利用统计假设检验中称为最大均值不等式(Maximum Mean Discrepancy, MMD)的技术,用于匹配原始分布与目标分布的所有阶数统计量。通过对所有矩统计量实施强正则化,该算法保证了条件得分函数在分布层面的收敛,并在各种超参数下保持稳定。经验上,我们展示了该方法MoMa QL在各种D4RL任务中计算效率更高,性能与或不相上下。令人惊讶的是,由于加速了基于流的策略的动作抽样过程,MoMa QL在离线到在线RL任务中展现出卓越的性能,因为其更快且更强的在线交互式微调能力。
引用
@article{arxiv.2605.29033,
title = {Moment Matching Q-Learning},
author = {Yiyan and Liang and Sifei Liu and Weitong Zhang},
journal= {arXiv preprint arXiv:2605.29033},
year = {2026}
}
备注
23 pages, 14 figures, 10 tables, accepted by ICML 2026