中文

偏好学习中的知识梯度

机器学习 2026-02-02 v1 机器学习

摘要

知识梯度是贝叶斯优化(BO)中用于优化带有噪声函数评估的黑盒目标的流行获取函数。然而,许多实际场景仅允许进行成对比较查询,导致偏好 BO 问题,其中不可直接进行函数评估。将知识梯度扩展到偏好 BO 面临计算挑战。其核心问题在于,需要计算非高斯后验,这以前被认为是不可计算的。在本文中,我们通过推导偏好 BO 的精确解析知识梯度来解决这一挑战。我们表明,精确知识梯度在一套基准问题上表现出色,常常优于现有的获取函数。此外,我们还提出了一个案例研究,说明知识梯度在某些情景下的局限性。

关键词

引用

@article{arxiv.2601.22335,
  title  = {Knowledge Gradient for Preference Learning},
  author = {Kaiwen Wu and Jacob R. Gardner},
  journal= {arXiv preprint arXiv:2601.22335},
  year   = {2026}
}