中文

基于离散评分的物品排序:未知用户阈值的代价

信息检索 2025-10-03 v1 机器学习

摘要

物品排序是许多信息检索和推荐系统中的核心任务。排序任务中的用户输入通常以粗粒度离散量表上的评分形式呈现。我们探讨是否有可能从这种粗粒度评分中恢复细粒度的物品排序。我们将物品建模为具有分数,将用户建模为具有阈值;如果物品的分数超过用户的阈值,则用户对该物品给出正面评分。尽管所有用户对物品的总排序达成一致,但当分数和阈值均为潜在变量时,估计该排序仍具挑战性。在我们的模型下,任何排序方法自然地将 nn 个物品划分为多个桶;桶之间是有序的,但每个桶内的物品仍是无序的。用户依次到达,每个新用户都可以被查询以细化当前排序。我们证明,以 Spearman 距离衡量,实现近乎完美的排序需要 Θ(n2)\Theta(n^2) 个用户(因此需要 Ω(n2)\Omega(n^2) 次查询)。这显著差于基于比较进行排序所需的 O(nlogn)O(n\log n) 次查询;这一差距反映了识别具有适当阈值的用户所需的额外查询。我们的界还通过二次散度因子量化了分数分布与阈值分布之间不匹配的影响。为了证明结果的紧致性,我们提供了一种排序算法,其查询复杂度在多对数因子范围内与我们的界相匹配。我们的工作揭示了在线排序中的一种矛盾:阈值的多样性对于将来自多个用户的粗粒度评分合并为细粒度排序是必要的,但如果阈值先验未知,这种多样性是有代价的。

关键词

引用

@article{arxiv.2510.01871,
  title  = {Ranking Items from Discrete Ratings: The Cost of Unknown User Thresholds},
  author = {Oscar Villemaud and Suryanarayana Sankagiri and Matthias Grossglauser},
  journal= {arXiv preprint arXiv:2510.01871},
  year   = {2025}
}

备注

12 pages, 4 figures