中文

从海量数据中发现高价值条目

机器学习 2015-06-08 v1 人工智能 信息论 math.IT

摘要

假设有大量的条目集合,每个条目具有相关的成本以及固有的效用,该效用仅在我们决定选择该条目后才揭示。给定所选条目累计成本的预算,我们如何挑选一个价值最大的子集?该任务推广了多臂老虎机、主动搜索和背包问题等若干重要问题。我们提出一种算法 GP-Select,它利用关于条目间相似性的先验知识,表示为核函数。GP-Select 使用高斯过程预测来平衡探索(估计条目的未知价值)与利用(选择高价值条目)。我们将 GP-Select 扩展为能够发现同时具有高效用且多样化的集合。我们对多样性的偏好可指定为任意单调子模函数,该函数量化了选择相似条目时获得的收益递减。此外,我们利用模型更新的结构,在实验中实现了数量级(高达 40X)的加速,而无需借助近似。我们提供了 GP-Select 性能的强保证,并将其应用于三个具有工业相关性的真实案例研究:(1)刷新旅游行业全球分销系统中的价格存储库,(2)在疫苗设计任务中识别多样化、结合亲和的肽,(3)通过向用户推荐条目在网页级推荐系统中最大化点击量。

关键词

引用

@article{arxiv.1506.00935,
  title  = {Discovering Valuable Items from Massive Data},
  author = {Hastagiri P. Vanchinathan and Andreas Marfurt and Charles-Antoine Robelin and Donald Kossmann and Andreas Krause},
  journal= {arXiv preprint arXiv:1506.00935},
  year   = {2015}
}