中文

“自带贪心”+Max:次模背包问题的近最优 $1/2$-近似

数据结构与算法 2019-10-15 v1 机器学习

摘要

从大型数据集中选取小规模代表性摘要是机器学习、优化与数据科学的基石问题。受推荐系统及以受限查询访问海量数据等场景的驱动,我们针对该问题的一个标准表述——受线性(背包)约束的次模最大化——提出了一个新的严格算法框架。我们的框架基于用最优额外一项扩充所有部分贪心解。它可在任何计算模型中以可忽略的开销实例化,从而允许实现经典的 \greedy 算法及其变体。我们在离线(Greedy+Max)、多遍流式(Sieve+Max)与分布式(Distributed+Max)设定下给出了此类实例化。我们的算法给出 (1/2ϵ1/2-\epsilon)-近似,且其他多数关键参数均近最优。我们的分析基于一组新的一阶线性微分不等式及其鲁棒近似版本。在典型数据集(电影推荐、影响力最大化)上的实验证实了该框架的可扩展性与解的高质量。实例特定近似通常处于 0.6–0.7 区间,并经常突破多项式时间算法的 (11/e)0.63(1-1/e) \approx 0.63 最坏情况屏障。

关键词

引用

@article{arxiv.1910.05646,
  title  = {"Bring Your Own Greedy"+Max: Near-Optimal $1/2$-Approximations for Submodular Knapsack},
  author = {Dmitrii Avdiukhin and Grigory Yaroslavtsev and Samson Zhou},
  journal= {arXiv preprint arXiv:1910.05646},
  year   = {2019}
}