中文

异构排名数据的联合学习

统计方法学 2025-07-02 v3

摘要

排名数据的统计建模历史悠久,涵盖了各种关于观察到的排名如何产生的不同视角。其中最常用的模型之一是 Plackett-Luce 模型,常用于将来自多个排名者的排名聚合到一个对应于被排对象原始质量的单一排名。鉴于排名者经常表现出异构的偏好,已发展出混合类型模型来将偏好更或更少均匀的排名者分组,从而减少偏差。然而,有时,这些偏好组是已知的。在这种情况下,当前做法是分别为每个组拟合 Plackett-Luce 模型。然而,不同的排名者组之间可能存在某些共性,使得分别估计会导致信息损失。我们提出了 Plackett-Luce 模型的一个扩展——稀疏融合 Plackett-Luce 模型(Sparse Fused Plackett-Luce model),允许对此类异构排名数据进行联合学习,利用不同组间的信息以实现更好的模型性能。观察到的排名可视为与被排对象变量有关的函数。因此,我们允许这些类型的变量,其中关于系数的信息在不同组之间共享。此外,由于并非所有变量都可能对对象的排名相关,因此我们对系数施加稀疏性,以提高模型的可解释性、估计和预测。仿真研究表明,所提方法在已有方法之上具有优越性能。为了说明该方法的用法和解释,本文提供了一个关于消费者对各种甜薯种类的偏好数据的应用案例。包含所提方法的 R 软件包可在 https://CRAN.R-project.org/package=SFPL 上找到。

关键词

引用

@article{arxiv.2407.10846,
  title  = {Joint Learning from Heterogeneous Rank Data},
  author = {Sjoerd Hermes and Joost van Heerwaarden and Pariya Behrouzi},
  journal= {arXiv preprint arXiv:2407.10846},
  year   = {2025}
}