中文

基于 Borda 计数的从 $m$ 元偏序中选取 Top-$k$ 的研究

数据结构与算法 2022-05-25 v1 机器学习 信号处理

摘要

我们在非参数模型中分析 Borda 计数算法的性能。该算法需要利用 mm 大小子集中物品的概率排序,以准确确定总共 nn 个物品中哪些物品是整体的 top-kk 物品。Borda 计数算法简单地从这些偏序观测中统计每个物品的累积分数。这推广了 Shah 等人使用概率成对比较数据的先前类似工作。Borda 计数算法的性能关键取决于第 kk 个物品与第 (k+1)(k+1) 个物品之间的相关分数间隔 Δk\Delta_k。具体而言,我们表明如果 Δk\Delta_k 大于某个值,则算法选出的 top-kk 物品几乎必然渐近准确;如果 Δk\Delta_k 低于某个值,则结果将以恒定概率不准确。在 m=2m=2 即成对比较的特殊情况下,所得界比 Shah 等人给出的更紧,从而缩小了错误概率上下界之间的差距。这些结果进一步扩展到近似 top-kk 选取设置。数值实验证明了 Borda 计数算法的有效性和准确性,与基于谱 MLE 的算法相比,尤其是在数据不一定遵循假定的参数模型时。

关键词

引用

@article{arxiv.2204.05742,
  title  = {On Top-$k$ Selection from $m$-wise Partial Rankings via Borda Counting},
  author = {Wenjing Chen and Ruida Zhou and Chao Tian and Cong Shen},
  journal= {arXiv preprint arXiv:2204.05742},
  year   = {2022}
}