中文

Softmax梯度策略用于方差最小化与风险规避多臂赌博机

机器学习 2026-04-02 v1 人工智能 数值分析 数值分析

摘要

多臂赌博机(MAB)问题的算法在序贯决策中扮演核心角色,已在理论和数值层面被广泛探索。虽然大多数经典方法旨在识别期望奖励最高的臂,但我们聚焦于风险感知场景,目标为选择方差最低的臂,偏好稳定性而非潜在高但不确定的回报。为建模决策过程,我们考虑策略的softmax参数化;提出一种新算法以选择最小方差(或最小风险)臂,并在自然条件下证明其收敛性。该算法通过从当前臂分布中进行两次独立采样,构造目标的无偏估计。我们提供数值实验以展示这些算法的实际行为,并为实现选择提供指导。该设置还涵盖一般的风险感知问题,即在最大化平均奖励与最小化其方差之间存在权衡。

关键词

引用

@article{arxiv.2604.00241,
  title  = {Softmax gradient policy for variance minimization and risk-averse multi armed bandits},
  author = {Gabriel Turinici},
  journal= {arXiv preprint arXiv:2604.00241},
  year   = {2026}
}