用于策略优化的 q-指数族
机器学习
2025-01-27 v3
摘要
策略优化方法受益于简单且可处理的策略参数化,通常连续动作空间中使用高斯分布。在本文中,我们考虑了一类更广泛但仍可处理的策略族:q-指数族。该策略族具有灵活性,允许指定重尾策略(q>1)和轻尾策略(q<1)。本文研究了 q-指数策略在多种在线和离线问题上的演员-评论家算法中的交互作用。我们发现重尾策略总体上更有效,并且可以一致地优于高斯策略。特别地,我们发现 Student's t 分布在各种设置下比高斯分布更稳定,而 Tsallis Advantage Weighted Actor-Critic 的重尾 q-Gaussian 在离线基准问题中持续表现良好。我们的代码可在 \url{https://github.com/lingweizhu/qexp} 获取。
引用
@article{arxiv.2408.07245,
title = {q-exponential family for policy optimization},
author = {Lingwei Zhu and Haseeb Shah and Han Wang and Yukie Nagai and Martha White},
journal= {arXiv preprint arXiv:2408.07245},
year = {2025}
}
备注
accepted by ICLR 2025