中文

面向模型误设的快速鲁棒排序聚合方法

机器学习 2023-05-08 v2 机器学习

摘要

在排序聚合(RA)中,不同用户的偏好集合在用户同质性假设下被汇总为一个全序。由于同质性假设在复杂现实情境中无法成立,RA 中会出现模型误设。现有的鲁棒 RA 通常借助排序模型的增广来刻画额外噪声,其中收集的偏好可被视为理想偏好的含噪扰动。由于大多数鲁棒 RA 依赖于特定的扰动假设,它们无法很好地推广到现实世界中无先验噪声污染的偏好。本文提出 CoarsenRank,其具备针对模型误设的鲁棒性。具体而言,CoarsenRank 的特性总结如下:(1)CoarsenRank 针对轻度模型误设而设计,其假设存在与模型假设一致、且位于实际偏好邻域内的理想偏好。(2)CoarsenRank 随后在偏好的邻域上执行常规 RA,而非直接在原数据集上执行。因此,CoarsenRank 在邻域内享有针对模型误设的鲁棒性。(3)数据集的邻域通过其经验数据分布定义。进一步地,我们对未知邻域大小施加指数先验,并推导出在特定散度度量下 CoarsenRank 极大简化的后验公式。(4)CoarsenRank 进一步实例化为 Coarsened Thurstone、Coarsened Bradly-Terry 与 Coarsened Plackett-Luce,对应三种流行的概率排序模型。同时,针对各实例化分别给出了易处理的优化策略。最后,我们在四个真实数据集上应用 CoarsenRank。

关键词

引用

@article{arxiv.1905.12341,
  title  = {Fast and Robust Rank Aggregation against Model Misspecification},
  author = {Yuangang Pan and Weijie Chen and Gang Niu and Ivor W. Tsang and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:1905.12341},
  year   = {2023}
}

备注

https://github.com/Numb3rs-UTS/Robust-Ranking-Aggregation--CoarsenRank