中文

GIPO:基于高斯重要性抽样的策略优化

机器学习 2026-03-05 v1 人工智能

摘要

后训练强化学习(RL)最近在推动多模态智能体超越监督模仿方面显示出巨大的潜力。然而,RL在数据效率方面仍受限,尤其是在交互数据稀缺且迅速变陈的环境中。为此,提出GIPO(Gaussian Importance sampling Policy Optimization),一种基于截断重要性抽样的策略优化目标,用基于对数比的高斯信任权重取代硬性剪裁,以柔和地抑制极端重要性比值,同时保持非零梯度。理论分析表明,GIPO引入了一个隐式、可调的对更新幅度的约束,同时集中界限保证了在有限样本估计下的鲁棒性和稳定性。实验结果表明,GIPO在从接近在-policy到高度陈旧数据的广泛回放缓冲区大小范围内,实现了基于剪裁的基线的最先进性能,同时表现出优异的偏差-方差权衡、高训练稳定性和改进的样本效率。

关键词

引用

@article{arxiv.2603.03955,
  title  = {GIPO: Gaussian Importance Sampling Policy Optimization},
  author = {Chengxuan Lu and Zhenquan Zhang and Shukuan Wang and Qunzhi Lin and Baigui Sun and Yang Liu},
  journal= {arXiv preprint arXiv:2603.03955},
  year   = {2026}
}