Top-k 排序的部分恢复:MLE 的最优性与谱方法的次最优性
统计理论
2021-07-16 v2 机器学习
统计理论
摘要
给定由 Bradley-Terry-Luce (BTL) 模型生成的 partially observed 成对比较数据,我们研究 top-k 排序问题。即最优地识别出前 k 名选手的集合。我们推导了关于归一化汉明损失的极小极大率。这提供了文献中首个以 top-k 排序错误比例刻画部分恢复误差的结果。我们还推导了 top-k 集合精确恢复的最优信噪比条件。最大似然估计量(MLE)被证明同时达到最优部分恢复与最优精确恢复。另一方面,我们表明另一流行算法——谱方法——在一般意义下是次最优的。我们的结果补充了 Chen 等人(2019)近期的工作,该工作表明 MLE 与谱方法均达到精确恢复的最优样本复杂度。事实表明两种算法的样本复杂度首项常数是不同的。另一可能具有独立意义的贡献是对 BTL 模型无惩罚或无正则化 MLE 的分析。这填补了排序文献中理论与实践之间的重要空白。
引用
@article{arxiv.2006.16485,
title = {Partial Recovery for Top-$k$ Ranking: Optimality of MLE and Sub-Optimality of Spectral Method},
author = {Pinhan Chen and Chao Gao and Anderson Y. Zhang},
journal= {arXiv preprint arXiv:2006.16485},
year = {2021}
}