中文

秩诱导 Plackett--Luce 镜像梯度:用于睡眠专家的秩忠实二阶算法

机器学习 2025-09-24 v1

摘要

我们提出了一种新算法,秩诱导 Plackett--Luce 镜像梯度(RIPLM),该算法利用 \citet{BergamOzcanHsu2022} 建立的“秩基准”与“分布基准”之间的结构等价性。不同于先前在专家身份上操作的方法,RIPLM 直接在秩诱导 Plackett--Luce(PL)参数化中进行更新。这确保了算法在每一轮中所使用的分布保持在秩诱导分布的类别中,从而保持与秩基准的等价性。据我们所知,RIPLM 是首个在睡眠专家环境中同时(i)“秩忠实”且(ii)“方差自适应”的算法。

关键词

引用

@article{arxiv.2509.18138,
  title  = {Rank-Induced PL Mirror Descent: A Rank-Faithful Second-Order Algorithm for Sleeping Experts},
  author = {Tiantian Zhang},
  journal= {arXiv preprint arXiv:2509.18138},
  year   = {2025}
}