中文

拉普拉斯核化赤字

机器学习 2026-01-05 v1 机器学习

摘要

我们研究多用户情境赤字问题,其中用户之间存在图结构关联且其奖励函数表现出非线性行为与图 homophily。我们提出一种原则性的联合惩罚机制,用于一组用户奖励函数 {fu}\{f_u\},将基于RKHS距离的图平滑项与单独的粗糙度惩罚相结合。我们的核心贡献在于证明该惩罚等价于单一统一的\emph{多用户RKHS}中的平方范数。我们显式推导其再生核,优雅地将图拉普拉斯与基础臂核融合。这种统一性使我们能够将问题重新表述为学习单个"提升"函数,从而设计出原则性算法 \texttt{LK-GP-UCB} 和 \texttt{LK-GP-TS},这些算法可利用对新型核函数的高斯过程后验进行探索。我们提供的高概率 regret 界限随着\emph{有效维度}而扩展,取代了对用户数量或环境维度的依赖。实验结果表明,我们的方法在非线性情境下超越强大的线性和非图感知基线,即使真实奖励为线性也能保持竞争力。我们的工作提供了一套统一、理论严谨且实用的方法,将拉普拉斯正则化与核化赤字相结合,用于结构化探索。

关键词

引用

@article{arxiv.2601.00461,
  title  = {Laplacian Kernelized Bandit},
  author = {Shuang Wu and Arash A. Amini},
  journal= {arXiv preprint arXiv:2601.00461},
  year   = {2026}
}