中文

带协变量的实体排序中极大似然估计的不确定性量化

统计方法学 2024-03-26 v2 机器学习 统计理论 机器学习 统计理论

摘要

本文关注基于带有额外协变量信息(如被比较项的属性)的成对比较的排序问题的统计估计与推断。尽管已有大量研究,鲜有文献在存在协变量信息这一更现实的设定下探讨该问题。为应对此问题,我们提出一种新颖模型——协变量辅助排序估计(CARE)模型,该模型通过纳入协变量信息扩展了著名的 Bradley-Terry-Luce (BTL) 模型。具体而言,我们不假设每个被比较项具有固定的潜在分数 {θi}i=1n\{\theta_i^*\}_{i=1}^n,而是假设潜在分数由 {αi+xiβ}i=1n\{\alpha_i^*+{x}_i^\top\beta^*\}_{i=1}^n 给出,其中 αi\alpha_i^*xiβ{x}_i^\top\beta^* 分别表示第 ii 个项的潜在基线与协变量分数。我们施加自然的不可辨识性条件,并利用一种新颖的‘留一法’技术(Chen et al., 2019),在稀疏比较图下推导出 {αi}i=1n\{\alpha_i^*\}_{i=1}^{n}β\beta^* 的极大似然估计的 \ell_{\infty}- 与 2\ell_2-最优收敛速率。为进行统计推断,我们进一步在最小样本复杂度下推导出 {αi}i=1n\{\alpha_i^*\}_{i=1}^nβ\beta^* 的 MLE 的渐近分布。这使我们能够回答某些协变量是否对潜在分数具有解释力的问题,并对某些稀疏参数进行阈值化以改进排序性能。我们改进了 (Gao et al., 2021) 中用于 BLT 模型的近似方法,并将其推广至 CARE 模型。此外,我们通过大规模数值研究以及共同基金持股数据集上的应用验证了我们的理论结果。

关键词

引用

@article{arxiv.2212.09961,
  title  = {Uncertainty Quantification of MLE for Entity Ranking with Covariates},
  author = {Jianqing Fan and Jikai Hou and Mengxin Yu},
  journal= {arXiv preprint arXiv:2212.09961},
  year   = {2024}
}

备注

81 pages, 3 figures