中文

基于广义双线性偏好的正则化在线RLHF

机器学习 2026-03-06 v2 计算机科学与博弈论 机器学习

摘要

我们考虑情境化在线RLHF问题,其中目标是识别纳什均衡。我们采用广义双线性偏好模型(GBPM)来捕捉可能的非传递偏好,通过低秩、反对称矩阵实现。我们研究针对任意强凸正则化器和正则化强度η1\eta^{-1}的通用偏好学习,超越仅限于逆KL正则化的先前工作。我们的分析核心是证明贪心策略的对偶间隙仅受估计误差平方的界限,这一结果仅基于强凸性和GBPM的反对称性得出。基于此洞见和特征多样性假设,我们通过两种简单算法建立两个 regret 上界:(1) 贪心抽样实现多对数级、eO(η)e^{\mathcal{O}(\eta)}-free regret O~(ηd4(logT)2)\tilde{\mathcal{O}}(\eta d^4 (\log T)^2)。(2) Explore-Then-Commit实现poly(d)\mathrm{poly}(d)-free regret O~(ηrT)\tilde{\mathcal{O}}(\sqrt{\eta r T}),通过低秩结构实现;这是高维度下在线RLHF的第一个统计有效保证。

关键词

引用

@article{arxiv.2602.23116,
  title  = {Regularized Online RLHF with Generalized Bilinear Preferences},
  author = {Junghyun Lee and Minju Hong and Kwang-Sung Jun and Chulhee Yun and Se-Young Yun},
  journal= {arXiv preprint arXiv:2602.23116},
  year   = {2026}
}

备注

43 pages, 1 table (ver2: more colorful boxes, fixed some typos)