拉普拉斯核化赤字
机器学习
2026-01-05 v1 机器学习
摘要
我们研究多用户情境赤字问题,其中用户之间存在图结构关联且其奖励函数表现出非线性行为与图 homophily。我们提出一种原则性的联合惩罚机制,用于一组用户奖励函数 ,将基于RKHS距离的图平滑项与单独的粗糙度惩罚相结合。我们的核心贡献在于证明该惩罚等价于单一统一的\emph{多用户RKHS}中的平方范数。我们显式推导其再生核,优雅地将图拉普拉斯与基础臂核融合。这种统一性使我们能够将问题重新表述为学习单个"提升"函数,从而设计出原则性算法 \texttt{LK-GP-UCB} 和 \texttt{LK-GP-TS},这些算法可利用对新型核函数的高斯过程后验进行探索。我们提供的高概率 regret 界限随着\emph{有效维度}而扩展,取代了对用户数量或环境维度的依赖。实验结果表明,我们的方法在非线性情境下超越强大的线性和非图感知基线,即使真实奖励为线性也能保持竞争力。我们的工作提供了一套统一、理论严谨且实用的方法,将拉普拉斯正则化与核化赤字相结合,用于结构化探索。
关键词
引用
@article{arxiv.2601.00461,
title = {Laplacian Kernelized Bandit},
author = {Shuang Wu and Arash A. Amini},
journal= {arXiv preprint arXiv:2601.00461},
year = {2026}
}