中文

基于梯度的贝叶斯偏好获取优化

机器学习 2019-11-22 v1 人工智能 机器学习

摘要

随着推荐系统变得越来越具有交互性和对话性,获取用户偏好的有效技术变得愈加重要。一个常见且概念上吸引人的选择查询的贝叶斯准则是期望信息价值(EVOI)。不幸的是,在具有大物品空间的推荐系统中,构建具有最大EVOI的查询在计算上是难以实现的。我们通过引入EVOI的连续公式来解决这个问题,该公式作为一个可微网络,可以使用现代机器学习计算框架(例如TensorFlow、PyTorch)中可用的梯度方法进行优化。我们利用这一点开发了一种新颖的、可扩展的蒙特卡洛方法用于EVOI优化,对于大物品空间,该方法比需要显式枚举物品的方法更具可扩展性。虽然我们强调这种方法用于物品的成对(或k项)比较,但我们也展示了我们的方法如何适应涉及物品属性子集或“部分物品”的查询,这些查询通常对用户来说在认知上更易管理。实验表明,我们基于梯度的EVOI技术在多个领域实现了最先进的性能,同时可扩展到大物品空间。

关键词

引用

@article{arxiv.1911.09153,
  title  = {Gradient-based Optimization for Bayesian Preference Elicitation},
  author = {Ivan Vendrov and Tyler Lu and Qingqing Huang and Craig Boutilier},
  journal= {arXiv preprint arXiv:1911.09153},
  year   = {2019}
}

备注

To appear in the Thirty-Fourth AAAI Conference on Artificial Intelligence (AAAI-20)